GraphMemory usa 85% menos tokens em memória de agentes LLM
Artigo no arXiv propõe o GraphMemory, memória em grafo que recupera apenas subgrafos relevantes por consulta e reduz em 81% a 85% os tokens de construção de memória em agentes de LLM.
Artigo no arXiv propõe o GraphMemory, memória em grafo que recupera apenas subgrafos relevantes por consulta e reduz em 81% a 85% os tokens de construção de memória em agentes de LLM.
Escolher um modelo de IA pelo ranking de benchmark é o caminho mais rápido para estourar o orçamento. O guia mostra os critérios que realmente decidem: tarefa, custo por token, latência, licença e um teste com os seus próprios dados.
O Seg-OPD treina modelos de linguagem a revisar passos intermediários do próprio raciocínio usando redrafts do professor como supervisão. O método registrou ganho médio relativo de 5,22% em acurácia em tarefas de matemática e programação competitiva. É um preprint, sem revisão por pares.
O Dual-Stream OSSE-LSTM, submetido ao arXiv em 2 de outubro de 2026, mantém acurácia entre 96,36% e 96,72% em 19 datasets do UCR com poucos rótulos por classe e supera baselines mesmo na pior configuração, com 93,99%.
O Ego2World, publicado no arXiv, compila vídeos egocêntricos de cozinha em ambientes de planejamento executáveis. Em teste com Qwen-Plus, crença persistente elevou a validade das ações em 4,15 pontos percentuais e reduziu consultas visuais em 90,27%.
Nuvem cobra por uso e escala rápido. On-premise exige investimento e dá controle total. O híbrido combina os dois para treinar fora e operar dentro.
O artigo arXiv:2609.38684v1 testou injeção de grafos de conceitos em transformers com controles de mecanismo desabilitado. A Forma A não mudou respostas e o ganho de F1 da Forma B veio sobretudo de capacidade adicional. Representação temporal e status epistêmico explícitos foram os componentes que realmente moveram a acurácia.
O arXiv publicou o preprint GATE-ST, que combina descrições textuais de genes com imagens de lâminas para prever expressão gênica espacial. O modelo superou embeddings aleatórios e outras arquiteturas de fusão imagem-texto nos testes relatados.
Estudo do arXiv mediu em 19.200 traces públicas o efeito de parar no teto de tokens ou deixar a derivação terminar. A escolha muda a acurácia em benchmarks como AIME e HMMT e exige divulgação conjunta do teto, custo e regra de parada.
Framework UniEvo-VL usa autocrítica como professora interna e eleva o Qwen-image-2512 de 0,747 para 0,808 no GenEval, sem professor externo.