Pesquisa
Resultados de benchmark, mergulhos de arquitetura e insights de engenharia de memória.
23 de agosto de 202611 min
75,5% no BEAM-100K: O que o Esforço de Raciocínio Faz com um Pipeline de Memória
Um leitor stealth e um parâmetro de API levaram nosso score médio no BEAM-100K de 69,3% para 75,5% (323/400 corretas). Não é SOTA. A parte interessante é de onde os pontos vieram, e de onde se recusaram a vir.
BEAMOx Alphareasoning effortColBERT
03 de agosto de 20268 min
Qualidade de Memória Vale Mais Que o Leitor: Evidência do BEAM-100K
Como engenharia de memória reader-agnostic fechou uma lacuna de 22 pontos no BEAM com GLM-5.2, um modelo open-weights que pontua mais alto em benchmarks de inteligência agentic que o Gemini 3.1 Pro.
BEAMbenchmarkGLM-5.2filtered-diskann

