Voltar ao blog
Engenharia
04 de julho de 2026
6 min de leitura

96,58% recall no LoCoMo: como construímos um engine de retrieval em CPU

Nosso run canônico da tabela completa mediu 96,58% recall@10 no LoCoMo. Esta é a arquitetura de retrieval por trás do resultado e por que o ranking não precisa de LLM.

O benchmark

LoCoMo (Long Context Memory) é um benchmark público e peer-reviewed para memória conversacional. Nossa tabela completa tem 1986 perguntas em 10 conversas. O líder open-source publicado (pmb) marcou 94,5%. O ValorBrain mediu 96,58%, uma margem de +2,1 pontos percentuais.

O pipeline

Nosso retrieval tem quatro estágios, fundidos num único scan de índice:

  1. BM25 (busca por palavra-chave) pega queries de match exato.
  2. Dense vectors (LFM2.5-Embedding-350M) tratam similaridade semântica. A troca de Jina v5-small para LFM2.5 levou o dense-only de 32,7% para 63,5% na ablação original.
  3. RRF (Reciprocal Rank Fusion) funde os resultados BM25 e dense.
  4. Personalized PageRank reordena os resultados por centralidade no grafo. Naquela ablação, este estágio acrescentou 2,4 pontos.

Sem LLM no ranking

O pipeline de ranking roda em CPU, abaixo de um segundo, com custo de token zero. Personalized PageRank é álgebra linear e não precisa de inferência de modelo.

Isso separa o custo de busca dos tokens de OpenAI ou Anthropic. A geração da resposta continua sendo outra etapa e pode usar um modelo de linguagem.

O que aprendemos

  • O modelo de embedding respondeu pela maior parte do ganho. A troca de Jina para LFM2.5 acrescentou 30,8 pontos na ablação original.
  • Busca híbrida cobre falhas diferentes. Dense-only perde matches exatos; BM25-only perde matches semânticos.
  • Personalized PageRank é barato. Uma operação de matriz por query entregou o ganho final baseado no grafo.

A camada end-to-end

LoCoMo mede retrieval. No BEAM-100K, o pipeline end-to-end acertou 323/400 perguntas (80,8% de acurácia binária) em 20 conversas. O run de 2026-08-23 usou GLM-5.3 Flash (Ox Alpha), effort=max e juiz GLM-5.2. O effort máximo acrescentou cerca de 44% de latência sobre o padrão; essa é uma configuração de benchmark, não o padrão de chat. Veja a metodologia e o relatório completo do run.

benchmarksretrievalLoCoMoperformance

Quer seu próprio cérebro corporativo?

ValorBrain conecta todos os seus agents IA numa base de conhecimento compartilhada.

Começar grátis