Desempenho mensurável em encontrar e usar o contexto certo
Para responder bem entre sessões, o sistema precisa encontrar a evidência certa e o reader precisa usá-la. O LoCoMo mede o primeiro passo; o BEAM-100K mede o pipeline end-to-end. Publicamos os números e a configuração de cada run.
- 96,58% evidence recall@10 no LoCoMo. +2,1 pp vs líder open-source publicado (94,5%)
- 80,8% de acurácia binária end-to-end no BEAM-100K (323/400 corretas em 20 conversas; reader GLM-5.3 Flash (Ox Alpha); juiz GLM-5.2; effort=max; run 2026-08-23; ~44% mais lenta que o effort padrão; esta configuração de benchmark não é o padrão do chat)
- Retrieval LoCoMo: ~0,84s por query em CPU · 0 chamadas de LLM no ranking
ValorBrain · LoCoMo
96,58%
evidence recall@10 · 1.986 perguntas
Líder open-source publicado
94,5%
pmb · recall@10
BEAM-100K · end-to-end
80,8%
323/400 corretas · 20 conversas
Latência ranking
~0,84s
CPU · 0 LLM no ranking
LoCoMo: +2,1 pontos percentuais vs pmb. Run canônico: 2026-07-29; 1.918/1.986 hits (96,58%).
BEAM-100K, run 2026-08-23: GLM-5.3 Flash (Ox Alpha), effort=max, juiz GLM-5.2. Essa configuração ficou cerca de 44% mais lenta que o effort padrão. É resultado end-to-end de benchmark, não o padrão do chat nem validação independente.
O que medimos e o que não medimos
Medimos
- Recuperação de evidência em conversas longas (LoCoMo recall@10)
- Respostas end-to-end entre sessões (acurácia binária BEAM-100K)
- Ranking sem chamada de LLM no caminho de retrieval
Não confundir com
- ·Isolamento multi-tenant ou filtragem de permissão por papel
- ·Handoffs de equipe, gaps de conhecimento ou selos de origem e veracidade
- ·Fidelidade das citações do Ask ou latência sob carga real de tenants
LoCoMo mede retrieval; BEAM-100K mede respostas end-to-end em conversas sintéticas. Permissão, origem e continuidade entre pessoas e agentes pertencem à camada de produto e ficam fora dos dois scores.
Por que isso importa para o produto
Em linguagem simples: quando alguém pergunta “o que decidimos?”, o sistema precisa trazer a evidência certa sem inventar e sem gastar LLM só para rankear. Isso é a base; por cima vêm permissão, origem e memória compartilhada entre pessoas e agents.
Rápido e barato no ranking
CPU, sub-segundo, zero chamada de LLM no passo de ranking. Custo previsível.
Privado no ranking
A query não precisa ir a um modelo de terceiros só para ordenar resultados.
EN + PT-BR
Stopwords e embeddings multilíngues. O produto roda no seu dia a dia em português.
Base do produto real
O mesmo núcleo alimenta Ask, MCP e memória da organização, com permissão e origem por cima.
Resultado por conversa (LoCoMo)
| Conversa | Documentos | Acertos | Perguntas | recall@10 |
|---|---|---|---|---|
| conv-26 | 19 | 191 | 199 | 96% |
| conv-30 | 19 | 102 | 105 | 97,1% |
| conv-41 | 32 | 188 | 193 | 97,4% |
| conv-42 | 29 | 252 | 260 | 96,9% |
| conv-43 | 29 | 236 | 242 | 97,5% |
| conv-44 | 28 | 154 | 158 | 97,5% |
| conv-47 | 31 | 180 | 190 | 94,7% |
| conv-48 | 30 | 230 | 239 | 96,2% |
| conv-49 | 25 | 187 | 196 | 95,4% |
| conv-50 | 30 | 198 | 204 | 97,1% |
| Total | — | 1.918 | 1.986 | 96,58% |
Metodologia (honesta e reproduzível)
- Isolamento por conversa: cada conversa em coleção limpa, consultada e purgada.
- Protocolo de evidence recall@10 alinhado ao LoCoMo publicado; hybrid retrieval + reordenação por grafo de conteúdo (detalhe de engenharia no repositório do engine).
- BEAM-100K no split completo, run 2026-08-23: 323/400 respostas corretas em 20 conversas. Reader GLM-5.3 Flash (Ox Alpha), effort=max; juiz GLM-5.2. Comparações entre sistemas com readers e juízes diferentes são apenas indicativas.
- Números desta página vêm de
lib/benchmarks.ts, fonte canônica do SaaS. Não inventamos percentuais na UI.
# Engine (repo valorbrain) — reprodutibilidade python3 scripts/locomo-benchmark.py \ --n-conversations 10 --topk 10 --chunk session --mode hybrid
O relatório do run BEAM-100K detalha configuração, latência e falhas em pesquisa técnica. Para o produto multi-tenant (permissão, gaps, veracity), use o dogfood no workspace e a página de segurança, não estes scores de conversa sintética.
Como isso se compara
Item por item contra as alternativas: memória de agente, busca corporativa e wiki. Sem tabela inflada: o que cada um faz e o que não faz.
Ver a comparaçãoQuanto isso economiza
A conta com os seus números: tamanho do time, horas perdidas procurando contexto e o que sobra depois. A premissa fica à vista, para você discordar dela.
Fazer a conta

Memória e contexto da organização
Prove o núcleo técnico aqui. Use o produto para permissão, origem e continuidade entre pessoas e agents.

