Prova técnica · atualizado 2026-08-23

Desempenho mensurável em encontrar e usar o contexto certo

Para responder bem entre sessões, o sistema precisa encontrar a evidência certa e o reader precisa usá-la. O LoCoMo mede o primeiro passo; o BEAM-100K mede o pipeline end-to-end. Publicamos os números e a configuração de cada run.

  • 96,58% evidence recall@10 no LoCoMo. +2,1 pp vs líder open-source publicado (94,5%)
  • 80,8% de acurácia binária end-to-end no BEAM-100K (323/400 corretas em 20 conversas; reader GLM-5.3 Flash (Ox Alpha); juiz GLM-5.2; effort=max; run 2026-08-23; ~44% mais lenta que o effort padrão; esta configuração de benchmark não é o padrão do chat)
  • Retrieval LoCoMo: ~0,84s por query em CPU · 0 chamadas de LLM no ranking

ValorBrain · LoCoMo

96,58%

evidence recall@10 · 1.986 perguntas

Líder open-source publicado

94,5%

pmb · recall@10

BEAM-100K · end-to-end

80,8%

323/400 corretas · 20 conversas

Latência ranking

~0,84s

CPU · 0 LLM no ranking

LoCoMo: +2,1 pontos percentuais vs pmb. Run canônico: 2026-07-29; 1.918/1.986 hits (96,58%).

BEAM-100K, run 2026-08-23: GLM-5.3 Flash (Ox Alpha), effort=max, juiz GLM-5.2. Essa configuração ficou cerca de 44% mais lenta que o effort padrão. É resultado end-to-end de benchmark, não o padrão do chat nem validação independente.

O que medimos e o que não medimos

Medimos

  • Recuperação de evidência em conversas longas (LoCoMo recall@10)
  • Respostas end-to-end entre sessões (acurácia binária BEAM-100K)
  • Ranking sem chamada de LLM no caminho de retrieval

Não confundir com

  • ·Isolamento multi-tenant ou filtragem de permissão por papel
  • ·Handoffs de equipe, gaps de conhecimento ou selos de origem e veracidade
  • ·Fidelidade das citações do Ask ou latência sob carga real de tenants

LoCoMo mede retrieval; BEAM-100K mede respostas end-to-end em conversas sintéticas. Permissão, origem e continuidade entre pessoas e agentes pertencem à camada de produto e ficam fora dos dois scores.

Por que isso importa para o produto

Em linguagem simples: quando alguém pergunta “o que decidimos?”, o sistema precisa trazer a evidência certa sem inventar e sem gastar LLM só para rankear. Isso é a base; por cima vêm permissão, origem e memória compartilhada entre pessoas e agents.

Rápido e barato no ranking

CPU, sub-segundo, zero chamada de LLM no passo de ranking. Custo previsível.

Privado no ranking

A query não precisa ir a um modelo de terceiros só para ordenar resultados.

EN + PT-BR

Stopwords e embeddings multilíngues. O produto roda no seu dia a dia em português.

Base do produto real

O mesmo núcleo alimenta Ask, MCP e memória da organização, com permissão e origem por cima.

Resultado por conversa (LoCoMo)

ConversaDocumentosAcertosPerguntasrecall@10
conv-261919119996%
conv-301910210597,1%
conv-413218819397,4%
conv-422925226096,9%
conv-432923624297,5%
conv-442815415897,5%
conv-473118019094,7%
conv-483023023996,2%
conv-492518719695,4%
conv-503019820497,1%
Total1.9181.98696,58%

Metodologia (honesta e reproduzível)

  • Isolamento por conversa: cada conversa em coleção limpa, consultada e purgada.
  • Protocolo de evidence recall@10 alinhado ao LoCoMo publicado; hybrid retrieval + reordenação por grafo de conteúdo (detalhe de engenharia no repositório do engine).
  • BEAM-100K no split completo, run 2026-08-23: 323/400 respostas corretas em 20 conversas. Reader GLM-5.3 Flash (Ox Alpha), effort=max; juiz GLM-5.2. Comparações entre sistemas com readers e juízes diferentes são apenas indicativas.
  • Números desta página vêm de lib/benchmarks.ts, fonte canônica do SaaS. Não inventamos percentuais na UI.
# Engine (repo valorbrain) — reprodutibilidade
python3 scripts/locomo-benchmark.py \
  --n-conversations 10 --topk 10 --chunk session --mode hybrid

O relatório do run BEAM-100K detalha configuração, latência e falhas em pesquisa técnica. Para o produto multi-tenant (permissão, gaps, veracity), use o dogfood no workspace e a página de segurança, não estes scores de conversa sintética.

Como isso se compara

Item por item contra as alternativas: memória de agente, busca corporativa e wiki. Sem tabela inflada: o que cada um faz e o que não faz.

Ver a comparação

Quanto isso economiza

A conta com os seus números: tamanho do time, horas perdidas procurando contexto e o que sobra depois. A premissa fica à vista, para você discordar dela.

Fazer a conta

Memória e contexto da organização

Prove o núcleo técnico aqui. Use o produto para permissão, origem e continuidade entre pessoas e agents.