首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GitHub 热门项目:llm-scraper

2026-09-03 1 阅读 约7分钟阅读 GitHub Trending
分享:
字号:
GitHub 项目:llm-scraper 仓库地址:https://github.com/mishushakov/llm-scraper 星级:6917 | 作者:米舒沙科夫 项目描述:使用法学硕士将任何网页转换为结构化数据 =================================================== 自述文件内容: # 法学硕士刮刀 屏幕截图 2024-04-20 23 11 16 LLM Scraper 是一个 TypeScript 库,允许您使用 LLM 从**任何**网页中提取结构化数据。 > [!重要] > **LLM Scraper 已更新至版本 2.0。** > > 新版本提供 **Vercel AI SDK 6** 支持和更新的示例。 ### 特点 - 支持GPT、Sonnet、Gemini、Llama、Qwen模型系列 - 使用 Zod 或 JSON Schema 定义的模式 - TypeScript 的完全类型安全 - 基于Playwright框架 - 流式传输对象 - [代码生成](#代码生成) - 支持6种格式化模式: - `html` 用于加载预处理的 HTML - `raw_html` 用于加载原始 HTML(不进行处理) - `markdown` 用于加载 markdown - `text` 用于加载提取的文本(使用 [Readability.js](https://github.com/mozilla/readability)) - 用于加载屏幕截图的“image”(仅限多模式) - 用于加载自定义内容的“custom”(使用自定义函数) **一定要给它一颗星!** 屏幕截图 2024-04-20 22 13 32 ## 开始使用 1. 从 npm 安装所需的依赖项: ```` npm i zod 剧作家 llm-scraper ```` 2. 初始化您的法学硕士: **开放人工智能** ```` npm 我@ai-sdk/openai ```` ````js 从 '@ai-sdk/openai' 导入 { openai } const llm = openai('gpt-4o') ```` **人择** ```` npm 我@ai-sdk/anthropic ```` ````js 从 '@ai-sdk/anthropic' 导入 { anthropic } const llm = anthropic('claude-3-5-sonnet-20240620') ```` **谷歌** ```` npm 我@ai-sdk/google ```` ````js 从“@ai-sdk/google”导入 {google} const llm = google('gemini-1.5-flash') ```` **格罗克** ```` npm 我@ai-sdk/openai ```` ````js 从 '@ai-sdk/openai' 导入 { createOpenAI } const groq = createOpenAI({ 基本URL:'https://api.groq.com/openai/v1', apiKey: process.env.GROQ_API_KEY, }) const llm = groq('llama3-8b-8192') ```` **奥拉马** ```` npm 我 ollama-ai-provider-v2 ```` ````js 从 'ollama-ai-provider-v2' 导入 { ollama } const llm = ollama('llama3') ```` 3. 创建 llm 提供的新 scraper 实例: ````js 从“llm-scraper”导入 LLMScraper const scraper = new LLMScraper(llm) ```` ## 示例 在此示例中,我们从 HackerNews 中提取头条新闻: ````ts 从“剧作家”导入 { chromium } 从 'zod' 导入 { z } 从“ai”导入{输出} 从 '@ai-sdk/openai' 导入 { openai } 从“llm-scraper”导入 LLMScraper // 启动浏览器实例 const 浏览器 = 等待 chromium.launch() // 初始化LLM提供者 const llm = openai('gpt-4o') // 创建一个新的 LLMScraper const scraper = new LLMScraper(llm) // 打开新页面 const page = 等待 browser.newPage() 等待页面.goto('https://n
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱