A maioria das ferramentas de chat com IA vive em sua própria aba. Você copia texto de uma página, cola em uma janela de chat e copia a resposta de volta. Assistência de Página remove essa viagem: é uma extensão de navegador de código aberto que abre um modelo em uma barra lateral ao lado de qualquer página que você esteja lendo, além de uma interface web em tela cheia para conversas mais longas.
Ela começou como uma interface para modelos locais executando no Ollama, e isso ainda é o padrão. Mas também aceita qualquer endpoint compatível com OpenAI, o que significa que a mesma barra lateral pode alternar entre um modelo pequeno no seu laptop e um modelo avançado na nuvem. Este guia passa por quatro fluxos de trabalho que as pessoas realmente usam, e para cada um diz quais recursos ativar e se um modelo local ou na nuvem se encaixa melhor.

Assistência de Página em um relance
As informações abaixo vêm do repositório do GitHub e da listagem da Chrome Web Store em 8 de outubro de 2026.
- Licença e custo: MIT, gratuito. Criado por um desenvolvedor independente (n4ze3m) com contribuições da comunidade.
- Adoção: cerca de 8.200 estrelas no GitHub; 300.000 usuários e uma classificação de 4.8 na Chrome Web Store.
- Pace de lançamento: semanal. A versão 1.5.86, lançada em 8 de outubro de 2026, adicionou AIHubMix à lista de provedores predefinidos.
- Navegadores: Chrome, Brave, Edge, Vivaldi, Firefox, LibreWolf, Zen. Opera e Arc têm a interface web, mas não a barra lateral.
- Privacidade: sem telemetria. O histórico de chat, configurações e embeddings da base de conhecimento permanecem no armazenamento do navegador.
Instale-a na Chrome Web Store (Firefox e Edge têm suas próprias páginas de complementos). Dois atalhos valem a pena aprender no primeiro dia: Ctrl+Shift+Y abre a barra lateral, Ctrl+Shift+L abre a interface web.
Qual fluxo de trabalho precisa do quê
| Fluxo de Trabalho | Recurso | Necessidades | Adequação do Modelo |
|---|---|---|---|
| Ler uma página longa | Chat com o Site | Modelo de chat | Nuvem para páginas longas |
| Reescrever texto selecionado | Menu Copilot | Modelo de chat | Local é suficiente |
| Perguntar sobre seus próprios arquivos | Base de Conhecimento | Chat + embedding | Qualquer um |
| Deixar o modelo agir | Ação da Página / MCP | Modelo de chamada de ferramenta | Nuvem |
"Adequação do modelo" é um ponto de partida, não uma regra. Um modelo local forte em uma boa GPU pode cobrir todas as quatro linhas.
Configuração única: um modelo local e um provedor na nuvem
Local: Ollama é detectado automaticamente
Se o Ollama estiver rodando em localhost:11434, a Assistência de Página o encontra sem nenhuma configuração e lista todos os modelos que você puxou. Se você ver um erro 403 ao enviar uma mensagem, é um problema de CORS: habilite a opção de origem personalizada nas Configurações → Configurações do Ollama, ou defina OLLAMA_ORIGINS=* e reinicie o Ollama.
Nuvem: escolha AIHubMix na lista de provedores
AIHubMix é um provedor embutido na Assistência de Página: desde a versão 1.5.86, ele está na lista suspensa de provedores ao lado do OpenAI, DeepSeek e outros, então não há URL para digitar. O fluxo segue o guia de provedores compatíveis com OpenAI da Assistência de Página:
- Crie uma chave de API no console do AIHubMix (o início rápido mostra onde).
- Na Assistência de Página, abra Configurações → API Compatível com OpenAI → Adicionar Provedor.
- Escolha AIHubMix na lista suspensa. A URL base
https://aihubmix.com/v1é preenchida para você. - Cole sua chave de API e salve.
- Uma lista de modelos aparece, buscada do AIHubMix. Pesquise, marque os modelos de chat que você deseja, deixe o tipo em Modelo de Chat, e salve.


Se você quiser verificar a chave antes de colá-la na extensão, uma solicitação é suficiente. A Assistência de Página se comunica com o AIHubMix através do mesmo endpoint de Chat Completions:
curl https://aihubmix.com/v1/chat/completions \
-H "Authorization: Bearer $AIHUBMIX_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model": "auto", "messages": [{"role": "user", "content": "ping"}]}'
auto é um nome de modelo real no AIHubMix: o Roteador LLM escolhe um modelo por solicitação (custo-primeiro por padrão, com variantes de qualidade-primeiro e latência-primeiro) e cobra pelo modelo que realmente usou. Adicionar auto como um dos seus modelos de Assistência de Página é um padrão razoável se você não quiser escolher. Navegue pela lista de modelos quando quiser escolher modelos específicos e comparar preços.
Modelo de embedding: necessário para dois dos quatro fluxos de trabalho
A Base de Conhecimento e o modo padrão de Chat com o Site precisam de um modelo de embedding. Defina-o em Configurações → Configurações RAG. Localmente, a Assistência de Página recomenda nomic-embed-text via Ollama. Através do AIHubMix, os modelos de embedding vêm da mesma lista de modelos que os modelos de chat. Abra novamente a lista de modelos do provedor, marque um modelo de embedding como gemini-embedding-001, e salve-o com o tipo definido como Modelo de Embedding. Ele então aparecerá na lista suspensa de Configurações RAG.

Fluxo de Trabalho 1: Lendo uma página longa sem sair dela
Abra a barra lateral em um artigo, uma página de documentação ou um tópico de issue do GitHub, e ative Chat com o Site. Agora você pode perguntar "quais são os três principais argumentos aqui?" ou "qual opção de configuração corrige o erro no comentário 14?" e o modelo responde a partir da página em que você está.
Existem duas maneiras de a página alcançar o modelo, e a diferença é importante:
- Modo de embedding (padrão): a página é dividida em partes, embutida, e apenas as partes relevantes vão para o modelo. Funciona com janelas de contexto pequenas, mas pode perder coisas que abrangem toda a página.
- Modo normal: o texto da página é enviado diretamente. Em Configurações de Recuperação, desative "Habilitar Embedding e Recuperação" e aumente "Tamanho Máximo do Conteúdo para Modo de Contexto Completo". Melhor para resumos e perguntas do tipo "compare a seção A com a seção D", mas precisa de um modelo com uma janela de contexto longa.
Esse segundo modo é onde um modelo na nuvem ganha seu lugar. Uma especificação longa ou um tópico de 200 comentários se encaixa confortavelmente em um modelo de nuvem de grande contexto, enquanto um modelo local pequeno precisaria que a página fosse reduzida.

Três recursos relacionados valem a pena conhecer:
- Menções @tab: digite
@para puxar outras abas abertas na mesma pergunta, por exemplo, comparando duas páginas de preços. Habilite isso nas configurações primeiro. - Botão de resumir do YouTube: um botão opcional nas páginas de vídeos do YouTube que abre a barra lateral e resume o vídeo, trabalhando a partir da transcrição da página.
- Visão: para páginas onde o conteúdo é principalmente imagens ou gráficos, o ícone de olho envia uma captura de tela da página para um modelo capaz de visão. Modelos sem visão podem recorrer ao OCR, que a própria documentação da Assistência de Página descreve como básico.
Fluxo de Trabalho 2: Selecionar texto, clicar com o botão direito, pronto
O menu Copilot é o fluxo de trabalho mais rápido na extensão. Selecione texto em qualquer página, clique com o botão direito e escolha uma ação sob a Assistência de Página. Cinco vêm embutidas: Resumir, Reescrever, Traduzir, Explicar e Personalizado.
O verdadeiro valor está em Prompt de Copilot Personalizado (Configurações → Gerenciar Prompts → Copilot Personalizado). Cada um é um título mais um modelo com {text} onde a seleção vai, e cada um se torna sua própria entrada de clique com o botão direito. Alguns que trazem retorno rápido:
Título: Responder em inglês simples
Prompt: Reescreva o seguinte para que um falante não nativo possa entender. Mantenha abaixo de 80 palavras.
{text}
Título: Encontrar a afirmação
Prompt: Liste cada afirmação factual no texto a seguir e marque as que precisam de uma fonte.
{text}
Essas tarefas são curtas e frequentes, então este é um bom lugar para um modelo local: sem custo por solicitação, sem viagem de rede, e o texto selecionado nunca sai da sua máquina. Mantenha o modelo na nuvem para seleções que são longas ou precisam de raciocínio real (uma cláusula densa de contrato, um bloco de código desconhecido).
O prompt de tradução embutido traduz para o inglês. Se você lê principalmente em outra direção, edite o prompt embutido ou adicione um personalizado com seu idioma-alvo.
Fluxo de Trabalho 3: Fazendo perguntas sobre seus próprios arquivos
A Base de Conhecimento transforma PDFs, documentos do Word, texto, CSV e arquivos Markdown em algo com o qual você pode conversar. Vá para Configurações → Gerenciar Conhecimento → Adicionar Novo Conhecimento, faça o upload dos arquivos e aguarde o processamento. Então, na entrada de chat, o ícone de conhecimento permite que você escolha qual coleção usar.

Duas coisas a saber antes de fazer upload de uma grande pasta:
- Tudo é processado e armazenado no navegador. A Assistência de Página alerta que isso pode causar problemas de desempenho com muitos dados. Comece com um conjunto focado de arquivos em vez de um arquivo completo.
- A qualidade da recuperação depende mais do modelo de embedding do que do modelo de chat. Se as respostas continuarem perdendo trechos óbvios, experimente um modelo de embedding mais forte antes de mudar os modelos de chat.
A escolha entre local e nuvem aqui é principalmente sobre os documentos. Arquivos internos que você não colaria em um serviço web são um caso para uma configuração totalmente local: embedding local mais modelo de chat local. Documentos públicos ou de produtos podem ir de qualquer maneira.
Fluxo de Trabalho 4: Deixando o modelo agir na página
Os fluxos de trabalho mais novos vão além da leitura. Dois recursos dão ferramentas ao modelo:
- Ação da Página é uma extensão companheira separada para navegadores Chromium. Com ela habilitada (o ícone do cursor na barra lateral), o modelo pode ler a aba atual e clicar, digitar, rolar, navegar e preencher formulários, um passo de cada vez. Ela é enviada separadamente porque precisa da permissão
debuggerdo Chrome, que a maioria dos usuários nunca precisa conceder. Veja a documentação da Ação da Página para configuração. - MCP permite que você conecte servidores MCP remotos via HTTP Streamable, com autenticação de token de portador ou OAuth 2.1. Servidores STDIO podem ser conectados ao HTTP com supergateway.
Ambos têm um interruptor de aprovação. "Requerer aprovação antes de cada ação" está ativado por padrão para Ação da Página. MCP é o oposto: ferramentas funcionam sem aprovação até que você ative "Requerer aprovação antes de executar ferramentas MCP", após o que cada ferramenta pode ser definida como Permitir, Humano no loop ou Desativar. Mantenha a aprovação ativada para qualquer coisa que envie formulários, mensagens ou escreva dados.

Este é o fluxo de trabalho onde a escolha do modelo importa mais. O uso de ferramentas em múltiplos passos precisa de um modelo que siga esquemas de ferramentas de forma confiável e se recupere de um passo errado, o que na prática significa um modelo de nuvem capaz. Um modelo local pequeno frequentemente ficará preso ou repetirá ações.
Local ou nuvem: uma maneira rápida de decidir
- Escolha local quando o texto é privado, a tarefa é curta (reescritas, traduções, explicações rápidas) ou você quer custo marginal zero.
- Escolha nuvem quando a página é longa, a pergunta precisa de raciocínio ao longo de todo o documento, ou o modelo precisa usar ferramentas.
- Cuidado com o que você envia: a Assistência de Página não coleta nada, mas qualquer coisa enviada a um provedor na nuvem sai da sua máquina. O AIHubMix afirma que não armazena conteúdo de prompt ou resposta, apenas metadados de solicitação, como contagens de tokens. Os fornecedores de modelos upstream têm suas próprias políticas de retenção.
Como ambos os tipos de modelo estão na mesma seleção de modelos, a troca é uma mudança de menu suspenso durante a conversa, não um aplicativo diferente.
Problemas comuns
- 403 ao conversar com Ollama: CORS. Habilite a URL de origem personalizada nas Configurações do Ollama, ou defina
OLLAMA_ORIGINS=*. - "Nenhum modelo encontrado" após adicionar um provedor: a chave de API está errada ou não tem saldo.
- Nenhum AIHubMix na lista suspensa: a extensão é mais antiga que 1.5.86. Atualize-a, ou escolha Personalizado e insira
https://aihubmix.com/v1. - Modelo de embedding não oferecido nas Configurações RAG: foi salvo como um Modelo de Chat. Adicione-o novamente com o tipo definido como Modelo de Embedding.
- Chat com o Site dá respostas superficiais: mude para o modo normal e use um modelo com uma janela de contexto mais longa.
- A barra lateral não abre: Opera e Arc não a suportam; use a interface web.
FAQ
A Assistência de Página é gratuita? Sim. É licenciada sob MIT e gratuita em todos os navegadores suportados. Você só paga se conectar um provedor na nuvem pago.
Preciso do Ollama para usar a Assistência de Página? Não. Ollama é o padrão, mas qualquer endpoint compatível com OpenAI funciona, incluindo LM Studio, llama.cpp, vLLM e gateways na nuvem como AIHubMix.
O AIHubMix está na lista suspensa de provedores? Sim, desde a versão 1.5.86. Escolha-o e cole sua chave de API; a URL base é preenchida. Em uma versão mais antiga, atualize a extensão primeiro.
A Assistência de Página envia meus dados de navegação para algum lugar? A Assistência de Página não tem telemetria e armazena o histórico localmente. O conteúdo da página é enviado apenas para o modelo com o qual você conversa. Se esse for um modelo na nuvem, o conteúdo vai para aquele provedor.
Qual modelo de embedding devo usar? Localmente, o nomic-embed-text através do Ollama é a recomendação documentada. Através do AIHubMix, escolha um como gemini-embedding-001 da mesma lista de modelos que os modelos de chat, e salve-o com o tipo definido como Modelo de Embedding.
Posso usar modelos diferentes para fluxos de trabalho diferentes? Sim. O seletor de modelos é por chat, então você pode manter um modelo local para reescritas rápidas e mudar para um modelo na nuvem para uma página longa na mesma sessão.
A Ação da Página funciona no Firefox? Não. A Ação da Página está disponível apenas em navegadores baseados em Chromium, como Chrome, Brave e Edge, porque depende do Protocolo DevTools do Chrome.



