页面助手实践:四种日常浏览器工作流程与本地和云模型

推理时代阅读约 9 分钟
页面助手实践:四种日常浏览器工作流程与本地和云模型

大多数AI聊天工具都在自己的标签页中。你从页面复制文本,粘贴到聊天窗口,然后再复制答案回来。 页面助手 消除了这种往返:它是一个开源浏览器扩展,可以在你正在阅读的页面旁边打开一个模型的侧边栏,以及一个用于更长对话的全标签网页UI。

它最初是为在Ollama中运行的本地模型提供的前端,至今仍然是默认设置。但它也接受任何兼容OpenAI的端点,这意味着同一个侧边栏可以在你笔记本上的小模型和云中的前沿模型之间切换。本指南介绍了人们实际使用的四种工作流程,并为每种工作流程说明了需要开启的功能以及本地模型或云模型哪个更合适。

页面助手一览

以下数据来自GitHub存储库和截至2026年10月8日的Chrome Web Store列表。

  • 许可证和费用:MIT,免费。由独立开发者(n4ze3m)和社区贡献者构建。
  • 采用情况:约8200个GitHub星标;30万用户和Chrome Web Store上的4.8评分。
  • 发布频率:每周。版本1.5.86于2026年10月8日发布,新增了AIHubMix到预设提供者列表。
  • 浏览器:Chrome、Brave、Edge、Vivaldi、Firefox、LibreWolf、Zen。Opera和Arc可以使用网页UI,但没有侧边栏。
  • 隐私:没有遥测。聊天记录、设置和知识库嵌入保留在浏览器存储中。

可以从 Chrome Web Store 安装它(Firefox和Edge有自己的附加页面)。有两个快捷键值得在第一天学习: Ctrl+Shift+Y 打开侧边栏, Ctrl+Shift+L 打开网页UI。

哪个工作流程需要什么

工作流程功能需求模型适配
阅读长页面与网站聊天聊天模型长页面使用云模型
重写选定文本副驾驶菜单聊天模型本地模型足够
询问自己的文件知识库聊天 + 嵌入任意
让模型执行操作页面操作 / MCP调用工具的模型云模型

“模型适配”是一个起点,而不是规则。强大的本地模型在良好的GPU上可以覆盖所有四行。

一次性设置:本地模型和云提供者

本地:Ollama自动检测

如果Ollama在 localhost:11434 上运行,页面助手会在没有任何配置的情况下找到它,并列出你拉取的每个模型。如果在发送消息时看到403错误,那是CORS问题:要么在设置中启用自定义来源选项,路径为设置 → Ollama设置,要么设置 OLLAMA_ORIGINS=* 并重启Ollama。

云:从提供者列表中选择AIHubMix

AIHubMix是页面助手的赞助商之一,自版本1.5.86以来,它在提供者下拉菜单中是一个预设,因此无需输入URL。流程遵循页面助手的 OpenAI兼容提供者指南:

  1. 在AIHubMix控制台中创建API密钥( 快速入门 显示了位置)。
  2. 在页面助手中,打开设置 → OpenAI兼容API → 添加提供者。
  3. 从下拉菜单中选择 AIHubMix 。基础URL https://aihubmix.com/v1 会自动填入。
  4. 粘贴你的API密钥并保存。
  5. 模型列表出现,从AIHubMix获取。搜索,勾选你想要的聊天模型,保持类型为 聊天模型 ,然后保存。

如果你想在粘贴到扩展之前检查密钥,只需发送一次请求即可。页面助手通过相同的聊天完成端点与AIHubMix进行通信:

curl https://aihubmix.com/v1/chat/completions \
  -H "Authorization: Bearer $AIHUBMIX_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "auto", "messages": [{"role": "user", "content": "ping"}]}'

auto 是AIHubMix上的真实模型名称: LLM路由器 根据请求选择模型(默认按成本优先,具有质量优先和延迟优先的变体),并对实际使用的模型进行计费。如果你不想选择,将 auto 作为你的页面助手模型之一是一个合理的默认选择。当你想选择特定模型并比较价格时,可以浏览 模型列表 。

嵌入模型:四种工作流程中需要两种

知识库和与网站聊天的默认模式需要嵌入模型。在设置 → RAG设置中进行设置。在本地,页面助手推荐通过Ollama使用 nomic-embed-text 。通过AIHubMix,嵌入模型来自与聊天模型相同的模型列表。再次打开提供者的模型列表,勾选一个嵌入模型,例如 gemini-embedding-001 ,并将类型设置为 嵌入模型 并保存。它将出现在RAG设置下拉菜单中。

工作流程1:在不离开页面的情况下阅读长页面

在一篇文章、文档页面或GitHub问题线程上打开侧边栏,并开启 与网站聊天 。你现在可以问“这里的三个主要论点是什么?”或“哪个配置选项修复了评论14中的错误?”模型会根据你所在的页面进行回答。

页面到模型有两种传递方式,差异很重要:

  • 嵌入模式(默认):页面被拆分成块,嵌入,只有相关块发送给模型。适用于小上下文窗口,但可能会遗漏跨越整个页面的内容。
  • 正常模式:页面文本直接发送。在检索设置中,关闭“启用嵌入和检索”,并提高“完整上下文模式的最大内容大小”。更适合摘要和“将A部分与D部分进行比较”的问题,但需要具有长上下文窗口的模型。

第二种模式是云模型发挥作用的地方。长规格或200条评论的线程在大型上下文云模型中可以舒适地适应,而小型本地模型则需要缩减页面。

有三个相关功能值得了解:

  • @tab提及:输入 @ 将其他打开的标签页拉入同一个问题,例如比较两个定价页面。首先在设置中启用它。
  • YouTube摘要按钮:在YouTube视频页面上的可选按钮,打开侧边栏并总结视频,基于页面的转录。
  • 视觉:对于内容主要是图像或图表的页面,眼睛图标将页面的截图发送到具有视觉能力的模型。没有视觉的模型可以回退到OCR,页面助手自己的文档将其描述为基本。

工作流程2:选择文本,右键,完成

副驾驶菜单是扩展中最快的工作流程。在任何页面上选择文本,右键单击,然后在页面助手下选择一个操作。内置了五个操作:摘要、改写、翻译、解释和自定义。

真正的价值在于 自定义副驾驶提示 (设置 → 管理提示 → 自定义副驾驶)。每个提示都是一个标题加上一个模板,模板中有 {text} ,其中选择的文本将放入,每个提示成为自己的右键条目。一些快速见效的示例:

标题:用简单英语回复
提示:将以下内容重写,以便非母语者可以理解。保持在80个单词以内。

{text}
标题:找到主张
提示:列出以下文本中的每个事实主张,并标记需要来源的主张。

{text}

这些任务简短且频繁,因此这是本地模型的好地方:没有每次请求的费用,没有网络往返,所选文本从未离开你的机器。将云模型保留用于长选择或需要真正推理的选择(密集的合同条款、一段不熟悉的代码)。

内置的翻译提示翻译成英语。如果你主要以另一种语言阅读,可以编辑内置提示或添加一个自定义提示,指定你的目标语言。

工作流程3:询问有关自己文件的问题

知识库将PDF、Word文档、文本、CSV和Markdown文件转化为可以聊天的内容。前往设置 → 管理知识 → 添加新知识,上传文件,等待处理。然后,在聊天输入中,知识图标让你选择使用哪个集合。

在上传大型文件夹之前,有两件事需要了解:

  • 所有内容都在浏览器中处理和存储。页面助手警告说,这可能会导致大量数据的性能问题。最好从一组集中文件开始,而不是整个档案。
  • 检索质量更多依赖于嵌入模型而不是聊天模型。如果答案总是遗漏明显的段落,尝试使用更强的嵌入模型,然后再切换聊天模型。

这里的本地与云选择主要与文件有关。你不会粘贴到网络服务中的内部文件是完全本地设置的案例:本地嵌入加本地聊天模型。公共论文或产品文档可以两者都使用。

工作流程4:让模型在页面上执行操作

最新的工作流程超越了阅读。两个功能为模型提供了工具:

  • 页面操作 是一个为Chromium浏览器提供的单独附加扩展。启用后(侧边栏中的光标图标),模型可以读取当前标签页并逐步点击、输入、滚动、导航和填写表单。它单独发布,因为它需要Chrome的 debugger 权限,大多数用户从未需要授予。请参阅 页面操作文档 以获取设置。
  • MCP 允许你通过Streamable HTTP连接远程MCP服务器,使用bearer-token或OAuth 2.1身份验证。STDIO服务器可以通过supergateway桥接到HTTP。

两者都有一个批准开关。“每次操作前需要批准”默认开启,适用于页面操作。MCP则相反:工具在没有批准的情况下运行,直到你开启“运行MCP工具前需要批准”,之后每个工具可以设置为允许、人工干预或禁用。对于任何提交表单、发送消息或写入数据的操作,请保持批准开启。

这是模型选择最重要的工作流程。多步骤工具使用需要一个可靠遵循工具模式并能从错误步骤中恢复的模型,这在实践中意味着一个强大的云模型。小型本地模型往往会停滞或重复操作。

本地或云:快速决策方法

  • 选择本地 当文本是私密的,任务较短(重写、翻译、快速解释),或你希望没有额外成本时。
  • 选择云 当页面较长,问题需要跨整个文档进行推理,或模型必须使用工具时。
  • 注意你发送的内容:页面助手本身不收集任何内容,但发送到云提供者的任何内容都会离开你的机器。AIHubMix声明它不存储提示或响应内容,仅存储请求元数据,例如令牌计数。上游模型供应商各自有自己的保留政策。

由于两种模型都在同一个模型选择器中,因此在对话中切换只需更改下拉菜单,而不是使用不同的应用程序。

常见问题

  • 与Ollama聊天时出现403错误:CORS。启用Ollama设置中的自定义来源URL,或设置 OLLAMA_ORIGINS=*。
  • 添加提供者后显示“未找到模型”:API密钥错误或没有余额。
  • 下拉菜单中没有AIHubMix:扩展版本低于1.5.86。请更新,或选择自定义并输入 https://aihubmix.com/v1。
  • 在RAG设置中未提供嵌入模型:它被保存为聊天模型。再次添加时将类型设置为嵌入模型。
  • 与网站聊天给出浅显的答案:切换到正常模式并使用具有更长上下文窗口的模型。
  • 侧边栏无法打开:Opera和Arc不支持;请使用网页UI。

常见问题解答

页面助手免费吗? 是的。它是MIT许可证,并在所有支持的浏览器上免费。只有在连接付费云提供者时才需付费。

我需要Ollama才能使用页面助手吗? 不需要。Ollama是默认的,但任何兼容OpenAI的端点都可以使用,包括LM Studio、llama.cpp、vLLM和云网关如AIHubMix。

AIHubMix在提供者下拉菜单中吗? 是的,自版本1.5.86以来。选择它并粘贴你的API密钥;基础URL会自动填入。在旧版本中,请先更新扩展。

页面助手会将我的浏览数据发送到任何地方吗? 页面助手没有遥测,历史记录存储在本地。页面内容仅发送到你聊天的模型。如果这是一个云模型,内容将发送到该提供者。

我应该使用哪个嵌入模型? 在本地,推荐通过Ollama使用nomic-embed-text。通过AIHubMix,从与聊天模型相同的模型列表中选择一个,例如gemini-embedding-001,并将类型设置为嵌入模型并保存。

我可以为不同的工作流程使用不同的模型吗? 可以。模型选择器是每个聊天的,因此你可以在快速重写时保留本地模型,并在同一会话中切换到云模型以处理长页面。

页面操作在Firefox上有效吗? 不。页面操作仅在基于Chromium的浏览器上可用,如Chrome、Brave和Edge,因为它依赖于Chrome DevTools协议。

来源