MAPA PAPER
  • IA
  • Tech
  • Negócios
  • Startups
  • Games
Newsletter
  • IA
  • Tech
  • Negócios
  • Startups
  • Games
  • Sobre
  • Metodologia
  • Newsletter
  • Home
  • Categoria
  • IA
HackProbe: monitor detecta reward hacking em modelos de linguagem autoevolutivos

HackProbe: monitor detecta reward hacking em modelos de linguagem autoevolutivos

Artigo no arXiv apresenta o HackProbe, monitor black-box que detecta reward hacking em modelos de linguagem autoevolutivos com 0,763 de AUROC e reduz falsos positivos de 0,706 para 0,434.

Por Redação Mapa Paper7 set
ERPBench: benchmark testa agentes de IA em decisões empresariais

ERPBench: benchmark testa agentes de IA em decisões empresariais

Benchmark ERPBench, publicado no arXiv, mostra que DeepSeek lidera em cenário Solo e Gemini em Arena, com os mesmos 100 problemas apontando vencedor comum em apenas 21 casos.

Por Redação Mapa Paper7 set
CGM-Rec: memória de grafos contínua melhora recomendação sob mudança de intenção

CGM-Rec: memória de grafos contínua melhora recomendação sob mudança de intenção

O CGM-Rec, framework de memória de grafos contínua publicado no arXiv em setembro de 2026, adapta sistemas de recomendação à mudança de intenção do usuário sem retreinar o modelo, com ganho de até 29,58% em HR@1 sobre o baseline de LLM mais forte no dataset Bundle.

Por Redação Mapa Paper7 set
DevRev NL2SQL: benchmark com 900 consultas desafia sistemas de linguagem natural para SQL

DevRev NL2SQL: benchmark com 900 consultas desafia sistemas de linguagem natural para SQL

Paper publicado no arXiv em setembro de 2026 apresenta o benchmark DevRev NL2SQL, com 900 consultas verificadas sobre esquemas empresariais aninhados, e uma arquitetura agêntica consciente de custo que atinge 91,7% de acerto, 54,6 pontos acima do melhor concorrente.

Por Redação Mapa Paper7 set
SiLR: novo método para agentes de IA com LLM melhora recuperação em cenários de energia

SiLR: novo método para agentes de IA com LLM melhora recuperação em cenários de energia

Paper no arXiv apresenta o SiLR, método de admissão estrutural para agentes de LLM que recupera 21/21 episódios em Gym-ANM contra 0/21 de gates escalares e bloqueia ações fisicamente inseguras que os métodos tradicionais deixam passar.

Por Redação Mapa Paper7 set
IRP: novo ataque envenena dados de IA preservando a qualidade das imagens

IRP: novo ataque envenena dados de IA preservando a qualidade das imagens

Artigo publicado no arXiv em 4 de setembro de 2026 apresenta o Imperfect Restoration Poisoning (IRP), método que envenena dados de treinamento de IA preservando a qualidade das imagens e superando o CUDA em oito baselines e cinco defesas testadas.

Por Redação Mapa Paper7 set
Estudo audita pipelines de IA e revela falhas na recuperação de objetos selecionados

Estudo audita pipelines de IA e revela falhas na recuperação de objetos selecionados

Estudo no arXiv audita 600 perguntas do HybridQA e mostra que o BM25 puro perde o objeto selecionado em 26,6% dos casos, enquanto a recuperação híbrida com reranking falha em apenas 1,0%. Pesquisadores lançam o Returned-Object Profile (ROP) para auditar handoffs em pipelines de IA.

Por Redação Mapa Paper7 set
Tau-tau-bench: benchmark testa agentes de IA construindo agentes de verdade

Tau-tau-bench: benchmark testa agentes de IA construindo agentes de verdade

O hyper-tau-bench, publicado no arXiv em 4 de setembro de 2026, avalia se agentes de IA conseguem construir agentes de atendimento completos. Claude Opus 5 sob Claude Code passou em 23,9% das simulações, contra 82,2% do teto escrito por especialistas.

Por Redação Mapa Paper7 set
Estudo mostra que supervisionar 0,05% dos tokens basta para treinar raciocínio de LLMs

Estudo mostra que supervisionar 0,05% dos tokens basta para treinar raciocínio de LLMs

Estudo no arXiv mostra que supervisionar apenas 0,05% dos tokens, um ou dois por trajetória, iguala ou supera o treino completo no pós-treinamento de LLMs. O resultado foi validado em nove configurações professor-aluno com Qwen3 e Llama.

Por Redação Mapa Paper7 set
La Agente Óptima: IA agente assume laboratórios autônomos de ciência

La Agente Óptima: IA agente assume laboratórios autônomos de ciência

Framework de IA apresentado no arXiv em setembro de 2026 supervisiona campanhas de otimização bayesiana em laboratórios autônomos sem especialistas humanos. Em química em fluxo, elevou o rendimento de 30% para 59% em 23 experimentos e cinco dias.

Por Redação Mapa Paper7 set
  • 17
  • 18
  • 19
  • 20
  • 21
  • →

Mais Lidas

Prompt injection: o que é e como prevenir ataques em LLMs

Prompt injection: o que é e como prevenir ataques em LLMs

Por Redação Mapa Paper10 out
Geometria semântica não dá julgamento confiável a agentes de IA

Geometria semântica não dá julgamento confiável a agentes de IA

Por Redação Mapa Paper8 out
D-OPCD: método destila experiência de agentes em pesos de difusão

D-OPCD: método destila experiência de agentes em pesos de difusão

Por Redação Mapa Paper8 out
MemMux governa memória de frotas de agentes de código

MemMux governa memória de frotas de agentes de código

Por Redação Mapa Paper8 out
NP-Bench: planejador zera conflitos entre agentes de código

NP-Bench: planejador zera conflitos entre agentes de código

Por Redação Mapa Paper8 out
MAPA PAPER

Redação autônoma especializada em inteligência artificial, tecnologia, negócios, startups e games.

Categorias

  • IA
  • Tech
  • Negócios
  • Startups
  • Games

Institucional

  • Sobre
  • Metodologia
  • Política Editorial
  • Correções
  • Fontes
  • Contato

Assine a Newsletter

Receba o melhor do Mapa Paper no seu email.

© 2026 The Mapa Paper. Todos os direitos reservados.

PrivacidadeTermos