Show HN: AboutIdeasNow – pesquisar páginas /about, /ideas, /now de mais de 7 mil sites pessoais

Um novo site, AboutIdeasNow, permite buscar as páginas /about, /ideas e /now de milhares de sites pessoais para encontrar outras pessoas com interesses semelhantes ou possíveis colaboradores. Os comentários elogiam o conceito e a interface, apontam dificuldades técnicas iniciais (rastreamento, análise de datas, limites de taxa, filtragem de spam) e sugerem melhorias como filtros melhores, navegação cronológica, resumos de autores e fluxos de revisão antispam usando LLMs. O projeto também desperta interesse mais amplo em padronizar caminhos de sites pessoais (/now, /ideas, /uses) e ligar esse ecossistema a redes sociais ou federadas para facilitar a descoberta de sites independentes.

Recepção geral e propósito

  • Reação fortemente positiva ao site; muitos o chamam de “incrível” e “legal”.
  • Visto como uma forma de descobrir pessoas interessantes, não apenas conteúdo.
  • Vários usuários imediatamente adicionam ou planejam adicionar páginas /about, /now, /ideas ou /uses aos seus próprios sites.
  • Tema comum: as pessoas têm muitas ideias, mas faltam tempo, execução ou colaboradores; essa ferramenta é vista como uma forma de encontrar pessoas com quem conversar ou colaborar.

Ideias vs execução

  • Vários comentários enfatizam que ideias são baratas; esforço e persistência importam mais.
  • Um desafio importante é encontrar uma ideia em que a pessoa acredite o suficiente para continuar depois que o entusiasmo inicial passar.
  • Alguns se preocupam que publicar ideias em público possa fornecer dopamina suficiente para reduzir a ação real depois.

Implementação técnica e confiabilidade

  • O site inicialmente foi “abraçado até a morte”: erros 500, limites de conexão com o banco de dados e uma instância do Typesense sobrecarregada; os problemas são reconhecidos e corrigidos/atualizados.
  • Usa GPT tanto para inferir datas de “última atualização” a partir do conteúdo quanto para classificar domínios como “pessoais”; isso leva a bugs como datas de 1969/1970 e sites classificados incorretamente.
  • Ferramentas de fallback (por exemplo, metascraper) e verificações adicionais são adicionadas; usuários sugerem suporte a JSON-LD e cabeçalhos HTTP precondition para nova raspagem.

Qualidade dos dados: sites pessoais, spam e 404s

  • Há preocupação de que muitos sites não pessoais ou corporativos estejam incluídos; a filtragem baseada em prompt do GPT gera falsos positivos.
  • Sugestões: permitir que o GPT expresse incerteza para revisão manual; usar embeddings para detectar “linguagem corporativa”.
  • Páginas 404 às vezes são indexadas; propostas incluem verificações de similaridade de conteúdo e tratamento mais rígido de códigos de status.
  • Spam e mudanças posteriores no conteúdo aumentam os pedidos por botões de denúncia e/ou revisão baseada em GPT.

Comportamento de busca e UX

  • A busca semântica é elogiada como “mágica” para encontrar pessoas que se aprofundaram em tópicos semelhantes.
  • Algumas consultas (por exemplo, “llm”, “gaza”) parecem aleatórias ou imprecisas; a capitalização parece afetar os resultados.
  • Os usuários pedem:
    • Listas cronológicas ou mega listas para cada caminho (especialmente /ideas e /now).
    • Filtragem mais fácil e visível entre /about, /ideas, /now.
    • Resumos de páginas /about baseados em LLM ao lado dos resultados.
    • Melhor feedback/verificação quando sites são enviados.

Ecossistema mais amplo e extensões

  • Iniciativas relacionadas mencionadas: convenções de páginas /uses e /wish, listas curadas de sites pessoais e um diretório web revivido (Curlie).
  • Alguns imaginam isso como base para uma rede social ou “motor de descoberta”, possivelmente aproveitando ActivityPub ou ideias da IndieWeb.
  • Outros sugerem expandir dos sites pessoais para a web mais ampla, enquanto o mantenedor questiona por que não usar busca geral para conteúdo não pessoal.