Show HN: AboutIdeasNow – pesquisar páginas /about, /ideas, /now de mais de 7 mil sites pessoais
Um novo site, AboutIdeasNow, permite buscar as páginas /about, /ideas e /now de milhares de sites pessoais para encontrar outras pessoas com interesses semelhantes ou possíveis colaboradores. Os comentários elogiam o conceito e a interface, apontam dificuldades técnicas iniciais (rastreamento, análise de datas, limites de taxa, filtragem de spam) e sugerem melhorias como filtros melhores, navegação cronológica, resumos de autores e fluxos de revisão antispam usando LLMs. O projeto também desperta interesse mais amplo em padronizar caminhos de sites pessoais (/now, /ideas, /uses) e ligar esse ecossistema a redes sociais ou federadas para facilitar a descoberta de sites independentes.
Recepção geral e propósito
- Reação fortemente positiva ao site; muitos o chamam de “incrível” e “legal”.
- Visto como uma forma de descobrir pessoas interessantes, não apenas conteúdo.
- Vários usuários imediatamente adicionam ou planejam adicionar páginas
/about,/now,/ideasou/usesaos seus próprios sites. - Tema comum: as pessoas têm muitas ideias, mas faltam tempo, execução ou colaboradores; essa ferramenta é vista como uma forma de encontrar pessoas com quem conversar ou colaborar.
Ideias vs execução
- Vários comentários enfatizam que ideias são baratas; esforço e persistência importam mais.
- Um desafio importante é encontrar uma ideia em que a pessoa acredite o suficiente para continuar depois que o entusiasmo inicial passar.
- Alguns se preocupam que publicar ideias em público possa fornecer dopamina suficiente para reduzir a ação real depois.
Implementação técnica e confiabilidade
- O site inicialmente foi “abraçado até a morte”: erros 500, limites de conexão com o banco de dados e uma instância do Typesense sobrecarregada; os problemas são reconhecidos e corrigidos/atualizados.
- Usa GPT tanto para inferir datas de “última atualização” a partir do conteúdo quanto para classificar domínios como “pessoais”; isso leva a bugs como datas de 1969/1970 e sites classificados incorretamente.
- Ferramentas de fallback (por exemplo, metascraper) e verificações adicionais são adicionadas; usuários sugerem suporte a JSON-LD e cabeçalhos HTTP precondition para nova raspagem.
Qualidade dos dados: sites pessoais, spam e 404s
- Há preocupação de que muitos sites não pessoais ou corporativos estejam incluídos; a filtragem baseada em prompt do GPT gera falsos positivos.
- Sugestões: permitir que o GPT expresse incerteza para revisão manual; usar embeddings para detectar “linguagem corporativa”.
- Páginas 404 às vezes são indexadas; propostas incluem verificações de similaridade de conteúdo e tratamento mais rígido de códigos de status.
- Spam e mudanças posteriores no conteúdo aumentam os pedidos por botões de denúncia e/ou revisão baseada em GPT.
Comportamento de busca e UX
- A busca semântica é elogiada como “mágica” para encontrar pessoas que se aprofundaram em tópicos semelhantes.
- Algumas consultas (por exemplo, “llm”, “gaza”) parecem aleatórias ou imprecisas; a capitalização parece afetar os resultados.
- Os usuários pedem:
- Listas cronológicas ou mega listas para cada caminho (especialmente
/idease/now). - Filtragem mais fácil e visível entre
/about,/ideas,/now. - Resumos de páginas
/aboutbaseados em LLM ao lado dos resultados. - Melhor feedback/verificação quando sites são enviados.
- Listas cronológicas ou mega listas para cada caminho (especialmente
Ecossistema mais amplo e extensões
- Iniciativas relacionadas mencionadas: convenções de páginas
/usese/wish, listas curadas de sites pessoais e um diretório web revivido (Curlie). - Alguns imaginam isso como base para uma rede social ou “motor de descoberta”, possivelmente aproveitando ActivityPub ou ideias da IndieWeb.
- Outros sugerem expandir dos sites pessoais para a web mais ampla, enquanto o mantenedor questiona por que não usar busca geral para conteúdo não pessoal.