Pesquisa
3 de agosto de 20268 min de leitura

Qualidade de Memória Vale Mais Que o Leitor: Evidência do BEAM-100K

Como engenharia de memória reader-agnostic fechou uma lacuna de 22 pontos no BEAM com GLM-5.2, um modelo open-weights que pontua mais alto em benchmarks de inteligência agentic que o Gemini 3.1 Pro.

BEAMbenchmarkGLM-5.2filtered-diskannmemoryretrieval

O ValorBrain pontua 70,9% no BEAM-100K (20 conversas, 400 perguntas) usando GLM-5.2 como modelo de resposta e Gemini 3.6 Flash como juiz. Isso está a 2,5 pontos do Hindsight, que faz 73,4% (single-query, Gemini 3.1 Pro), e o ValorBrain vence em 5 das 10 categorias de habilidade de memória, incluindo uma vantagem de 24 pontos em Extração de Informação.

58% da nossa melhoria total veio de engenharia de memória reader-agnostic. Consolidação, linha do tempo e melhorias de entrega que beneficiam qualquer LLM. A troca do leitor contribuiu com 42%. Para sistemas de produção onde os usuários trazem seu próprio LLM, qualidade de memória importa mais que qualidade do leitor.


Resultados

SistemaPontuaçãoPerguntasLLM de RespostaLLM Juiz
ValorBrain70,9%400 (20 conv)GLM-5.2Gemini 3.6 Flash
ValorBrain (inicial)55,9%100 (5 conv)deepseek-v4-flashdeepseek-v4-flash
Hindsight (single-query)73,4%400Gemini 3.1 ProGemini 2.5 Flash Lite
Hindsight (RAG)86,2%400Gemini 3.1 ProGemini 3.5 Flash

Por Categoria vs Hindsight

CategoriaValorBrainHindsight (sq)Diferença
Extração de Informação88,9%64,9%+24,0
Raciocínio Temporal71,9%57,5%+14,4
Atualização de Conhecimento70,6%58,8%+11,8
Raciocínio Multi-sessão57,2%47,4%+9,8
Resolução de Contradição67,2%61,6%+5,6
Seguir Preferências91,0%95,0%-4,0
Seguir Instruções83,8%91,2%-7,5
Sumarização64,5%79,3%-14,8
Ordenação de Eventos46,4%80,5%-34,1
Abstenção67,5%97,5%-30,0

O ValorBrain vence em 5 das 10 categorias. As perdas estão concentradas em Abstenção (-30,0, uma distinção semântica do lado do leitor) e Ordenação de Eventos (-34,1, onde estrutura cronológica precisa de mais trabalho).


A Decomposição: Memória vs Leitor

MelhoriaTipoPontosParticipação
Consolidação em delivered_documentsMemória+10,145%
Consolidação rica (contagens, 4K tokens) + Linha do tempoMemória+3,616%
GLM-5.2 + max_tokens 8192Leitor + infra+7,332%
Variância de execução+1,57%
Total+22,5

58% da melhoria é reader-agnostic. A engenharia de memória contribui mais que a troca do leitor.


Por Que a Consolidação Funciona

A maior melhoria individual (+10,1 pontos) veio de incluir fatos pré-sintetizados da conversa como um documento sintético na saída de recuperação. Em vez de forçar o LLM a extrair fatos específicos de janelas de conversa espalhadas, a consolidação os entrega pré-extraídos.

Isso é reader-agnostic por design. A consolidação é gerada offline e armazenada. Qualquer LLM de resposta recebe os mesmos fatos pré-sintetizados. A melhoria transfere entre leitores porque reduz o trabalho de extração, não porque depende de raciocínio específico do leitor.

O impacto foi mais visível em Sumarização (0,8% para 64,5%) e Raciocínio Multi-sessão (32,5% para 57,2%). Ambos exigem agregar fatos espalhados por muitos turnos. A consolidação faz esse trabalho antecipadamente.


GLM-5.2 vs Gemini 3.1 Pro

O GLM-5.2 pontua mais alto que o Gemini 3.1 Pro no Artificial Analysis Intelligence Index (51 vs 46), com força particular em tarefas agentic. O GLM-5.2 custa metade ($0,86 vs $1,74 por 1M tokens), é mais rápido (187 vs 131 tokens/s), e é open-weights.

GLM-5.2 não é um compromisso na qualidade do leitor. Pontua mais alto em inteligência, custa metade, e é open-weights.


Um Endpoint, Qualquer Consumidor

O ValorBrain expõe recuperação através de um único endpoint /api/v1/memory/prepare que retorna delivered_documents: chunks limpos e agnósticos ao consumidor. O mesmo endpoint serve nosso agente de produção, o benchmark AMB, e qualquer cliente externo.

Não existe modo benchmark versus modo produção. A qualidade de memória medida pelo benchmark é a qualidade de memória entregue aos usuários.


Limitações

  • Os resultados refletem o conjunto completo de 20 conversas do BEAM-100K. Escalas maiores (1M, 10M) estão pendentes.
  • Apenas GLM-5.2 e deepseek-v4-flash foram testados como LLMs de resposta. Resultados com Claude ou GPT-4o podem diferir. As melhorias reader-agnostic devem transferir.
  • Abstenção: a verificação lexical de disponibilidade que implementamos não cobre os casos sutis de abstenção do BEAM (tópico existe, detalhe não). Isso precisa de raciocínio semântico além do que um sistema de memória pode fornecer sem o leitor.
  • Ordenação de Eventos: a entrega da linha do tempo melhorou os resultados mas ainda fica atrás do Hindsight. Um documento estruturado de sequência de eventos (não apenas fatos ordenados) pode fechar a lacuna.
  • Variância do juiz: o juiz LLM do BEAM introduz variância de pontuação. Comparações entre implementações devem considerar modelos juiz diferentes.

Conclusão

O ValorBrain pontua 70,9% no BEAM-100K usando GLM-5.2, competitivo com os 73,4% do Hindsight (Gemini 3.1 Pro), e vence em 5 das 10 categorias de habilidade de memória. Engenharia de memória reader-agnostic contribuiu com 58% da melhoria total.

Para uma plataforma de memória multi-tenant onde os usuários trazem seu próprio LLM, a implicação é prática. Investir em engenharia de memória (consolidação, linha do tempo, entrega estruturada) beneficia todo usuário independentemente do LLM que escolher. Investir em um leitor mais forte beneficia apenas aquele leitor.


Reproduzindo

Os resultados são reproduzíveis via o Agent Memory Benchmark com o provider ValorBrain. Crie uma conta ValorBrain em valorbrain.valor.digital para obter uma chave de API.


Referências

  1. Tavakoli et al. (2025). "Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs." ICLR 2026.
  2. Vectorize/Hindsight. "Agent Memory Benchmark (AMB)." https://github.com/vectorize-io/agent-memory-benchmark
  3. Artificial Analysis. "GLM-5.2 vs Gemini 3.1 Pro Preview." https://artificialanalysis.ai/models/comparisons/glm-5-2-vs-gemini-3-1-pro-preview