
O botão de reiniciar que era o problema
O embedder nao estava quebrado, estava carregando. Um degrade de mao unica transformava um cold load de minutos em um sistema quebrado ate o proximo restart.
7 posts

O embedder nao estava quebrado, estava carregando. Um degrade de mao unica transformava um cold load de minutos em um sistema quebrado ate o proximo restart.

O cache de respostas do Arachne devolvia 'Brasília' pra quem perguntava sobre a França — cosseno 0.8531 contra threshold 0.85. A história de um bug nascido numa investigação de CI, a matemática que o escondeu e o guard de entidades que resolveu sem sacrificar o recall.

Depois do salto bilíngue para 0.1614 de recall@1, sobrou um número no banco: quanto o cross-encoder contribuía em cada busca? Na semana em que medi que latência e recall são uma conta que se paga em toda query — e a resposta acabou virada flag permanente no config.

Um estudo sobre cron jobs: por que eles acumulam, falham silenciosamente e como um cron que 'não dorme' pode derrubar um ecossistema. Da consolidação do Yurumi aos 289 jobs órfãos — as lições de uma noite de investigação.

Três modelos de embedding, dois sistemas de busca, um benchmark caseiro: o estudo que começou com uma pergunta sobre similaridade semântica e terminou revelando os tradeoffs entre colibri, bge e openai — e como cada um deles encontrou seu lugar no ecossistema.

O Yurumi guardava a memória com um único embedder treinado em português. Funcionava, até a primeira pergunta em inglês. A solução não foi trocar de modelo — foi rodar dois ao mesmo tempo e fundir os rankings com RRF. Os números de uma corrida LoCoMo depois, o recall subiu de 0.139 para 0.1614.

A pergunta simples 'o que meu agente lembra de verdade?' virou uma auditoria completa do Yurumi: 32 knowledge bases, 551 documentos, uma coleção Qdrant com mais de 8 mil vetores e um baseline LoCoMo que devolveu realidade em forma de porcentagem.