Hister: um mecanismo de busca privado para as páginas que você visita e os arquivos que guarda

Uma nova ferramenta de código aberto chamada Hister transforma seu histórico de navegação, favoritos, arquivos locais e até conteúdo de redes sociais em um índice privado e pesquisável em texto completo que fica nas suas próprias máquinas. Comentadores a comparam a iniciativas antigas como Google Desktop, ArchiveBox, Zotero e várias soluções caseiras, elogiando sua capacidade de recuperar páginas visitadas anteriormente enquanto debatem trade-offs entre hospedagem local e na nuvem, integrações com navegador e arquivamento de longo prazo. O autor do projeto comenta recursos planejados, suporte a vários dispositivos, a pressão legal para renomear o projeto e possíveis integrações com LLMs locais e outros serviços auto-hospedados.

Visão geral e propósito

  • A ferramenta constrói um mecanismo de busca privado sobre as páginas que você visita e os arquivos que guarda.
  • O foco é a recuperação de conhecimento pessoal, não a busca geral na web.
  • Funciona como um índice de páginas visitadas, favoritos, histórico do navegador, arquivos locais e sites rastreados.

Recursos e arquitetura

  • Armazena o conteúdo extraído das páginas com pré-visualizações offline, para que os resultados permaneçam mesmo se a fonte mudar ou desaparecer.
  • Suporta busca em texto completo e busca semântica, tem uma interface web, CLI e endpoint MCP para integrações com IA/assistentes.
  • A extensão do navegador indexa o que realmente é renderizado nas abas, permitindo capturar conteúdo atrás de logins e em sites “fechados” (Instagram, Discord, Twitter, transcrições do YouTube via yt-dlp, etc.).
  • Pode ser usado em várias máquinas e em configurações multiusuário; sem componente de nuvem obrigatório.

Comparações com outras ferramentas

  • Comparado ao ArchiveBox: este foca em recuperação rápida de conhecimento; o ArchiveBox, em preservação de longo prazo. Alguns usuários querem um único arquivo compartilhado, não dois.
  • As pessoas mencionam ferramentas semelhantes ou adjacentes: linkwarden/linkding/Betula, Zotero, SingleFile, Google Desktop, a antiga busca do histórico do Chrome/Opera, recoll e vários indexadores de histórico feitos em casa.
  • Alguns o veem como um equivalente moderno de ferramentas poderosas de busca local que os navegadores desde então “amansaram”.

Privacidade, segurança e preocupações de hospedagem

  • Há forte interesse em manter os dados locais e evitar dependência de LLMs na nuvem; outros se sentem confortáveis em colocá-lo na frente com ChatGPT ou modelos locais como uma “camada de raciocínio”.
  • Alguns desconfiam de executar qualquer coisa fora dos repositórios da distribuição ou se preocupam com vulnerabilidades de segurança; as sugestões incluem contêineres, AppArmor, endurecimento com systemd e segmentação rígida de rede.
  • Alguns preferem alternativas de baixa tecnologia, como imprimir páginas em PDF junto com pdfgrep.

Relatos de uso no mundo real

  • Vários usuários relatam semanas a meses de uso e o chamam de “inestimável” para encontrar links esquecidos, indexar notas/Obsidian e tornar conteúdo social/web pesquisável.
  • Houve um relato de sérios problemas de recursos quando o serviço foi colocado atrás de proxy reverso via Nginx; a causa raiz não ficou clara.

Limitações e pedidos de recursos

  • Recursos desejados:
    • notas/anotações em páginas, filtros apenas de favoritos, limites de tempo de visibilidade (por exemplo, indexar apenas abas visualizadas por >4s), manter versões antigas e diffs, indexação de e-mails, suporte a Android/Chrome, mais integrações com gerenciadores de favoritos.
  • Alguns questionam o retorno pessoal de construir bases de conhecimento elaboradas e preferem minimalismo.

Nome e disputa de marca registrada

  • O nome atual conflita com uma marca registrada existente nos EUA; os mantenedores esperam renomear.
  • A discussão contém muitas sugestões de nomes alternativos e debate sobre se uma mudança de nome é legalmente necessária.