Geometria semântica não dá julgamento confiável a agentes de IA

Geometria semântica não dá julgamento confiável a agentes de IA

Um estudo no arXiv testou se a geometria semântica de vetores bastaria para agentes de IA decidirem quais regras seguir. Em quatro experimentos, o julgamento pré-ação não se mostrou confiável. Um roteador lexical recuperou todas as políticas e cortou a mediana de checagens em 97,7%, mas o pipeline ainda escalou 2.304 ações, inclusive as permitidas.

Por Redação Mapa Paper8 out
D-OPCD: método destila experiência de agentes em pesos de difusão

D-OPCD: método destila experiência de agentes em pesos de difusão

Pesquisadores publicaram no arXiv um método que destila o conhecimento de agentes de IA diretamente nos pesos de modelos de difusão. O D-OPCD elevou a pontuação média de geração direta de 60,52 para 65,09 em quatro benchmarks e abriu caminho para coevolução contínua entre harness e modelo.

Por Redação Mapa Paper8 out
MemMux governa memória de frotas de agentes de código

MemMux governa memória de frotas de agentes de código

O MemMux, runtime local apresentado no arXiv, manteve uma frota de agentes de código dentro de 7,5 GiB de RAM e sem swap, enquanto ferramentas sem governança estouraram o teto e derramaram cerca de 2 GiB em swap. O sistema recupera 100% da subárvore de processos de um agente encerrado e detecta 10 de 10 processos escapados, mas consome 2,7% de CPU com dez agentes, acima da meta de 2%.

Por Redação Mapa Paper8 out
NP-Bench: planejador zera conflitos entre agentes de código

NP-Bench: planejador zera conflitos entre agentes de código

Planejador embutido no Nerveplane trata coordenação de agentes de código como escalonamento e leva a integração limpa de 1/9 para 9/9 cenários, cortando conflitos de merge de 13 para 0, segundo o paper arXiv:2610.07261v1.

Por Redação Mapa Paper8 out
Trust Layer para agentes de IA verifica se o score foi realmente merecido

Trust Layer para agentes de IA verifica se o score foi realmente merecido

Um novo framework do arXiv verifica se o score de um agente de IA foi realmente conquistado, reportado com honestidade e estável em cinco execuções. Aplicado a 108 tarefas do Agents' Last Exam, apenas 22,6% dos passes registrados passaram por todas as quatro checagens.

Por Redação Mapa Paper8 out
Verificação de admissibilidade em memória de agentes de IA

Verificação de admissibilidade em memória de agentes de IA

O artigo arXiv:2610.07309 propõe um framework que classifica cada par memória-consulta como admissível, inadmissível ou não resolvido. Nos benchmarks RHELM e MemOps, o recall das âncoras no top-20 sobe de 0,432 para 0,533 e as avaliações de similaridade exata caem 98,3%.

Por Redação Mapa Paper7 out
Paper mapeia linguagens de regras para IA neurosimbólica

Paper mapeia linguagens de regras para IA neurosimbólica

Levantamento no arXiv compara Datalog, answer set e probabilistic logic programs como camada simbólica de sistemas neurosimbólicos, analisando mais de 50 aplicações em bancos de dados, machine learning, visão e robótica.

Por Redação Mapa Paper7 out
RGPO: método reduz esparsidade de recompensa em LLMs

RGPO: método reduz esparsidade de recompensa em LLMs

O artigo arXiv 2610.07342v1 apresenta o RGPO, framework que usa justificativas de referência como andaimes temporários no aprendizado por reforço e transfere de volta apenas as soluções de maior recompensa geradas pelo próprio modelo. Os autores relatam ganhos sobre baselines de RLVR em cenários de linguagem e de visão e linguagem.

Por Redação Mapa Paper7 out
TLAR: paper usa histórico do próprio modelo para acelerar inferência de IA

TLAR: paper usa histórico do próprio modelo para acelerar inferência de IA

O artigo arXiv:2610.07350v1 apresenta o TLAR, método que recupera continuations do próprio histórico do modelo e as combina com rascunhos gerados em uma árvore de candidatos compartilhada. Testado em código, matemática e escrita aberta, o método eleva a aceitação de tokens e o throughput.

Por Redação Mapa Paper7 out