The Mapa Paper — IA, Tech, Negócios, Startups e Games
D-OPCD: método destila experiência de agentes em pesos de difusão
Pesquisadores publicaram no arXiv um método que destila o conhecimento de agentes de IA diretamente nos pesos de modelos de difusão. O D-OPCD elevou a pontuação média de geração direta de 60,52 para 65,09 em quatro benchmarks e abriu caminho para coevolução contínua entre harness e modelo.
MemMux governa memória de frotas de agentes de código
O MemMux, runtime local apresentado no arXiv, manteve uma frota de agentes de código dentro de 7,5 GiB de RAM e sem swap, enquanto ferramentas sem governança estouraram o teto e derramaram cerca de 2 GiB em swap. O sistema recupera 100% da subárvore de processos de um agente encerrado e detecta 10 de 10 processos escapados, mas consome 2,7% de CPU com dez agentes, acima da meta de 2%.
Escolha do Dia
Escolha do Dia
Mais Recentes
Semantic Entropy no Roteamento de LLMs: Checklist Contra Falsos Resultados
Estudo no arXiv propõe cinco verificações para avaliar sinais de escalonamento em roteamento de LLMs. No GSM8K, a entropia semântica alcançou AUROC de 0,871 e ganho de até nove pontos, mas um teste sintético mostrou que uma regra de dificuldade sem modelo chegava ao mesmo resultado.
Como escolher entre jogos digitais e mídia física no console
Comparativo entre jogos digitais e mídia física que separa os critérios reais de decisão: revenda, promoções, dependência de servidores, console sem leitor e colecionismo.
Escolha do Editor
Artigos
Mais Populares
GTA 6 não vai mirar pessoas ou eventos reais, diz Rockstar
Rupert Humphries, vice-presidente sênior de narrativa da Rockstar, disse que GTA 6 não vai ser específico sobre pessoas, eventos ou movimentos reais. A política aparece em cartazes, robocalls e programas de rádio, não em caricaturas identificáveis.
Alucinações em LLMs: o que são e como reduzir o risco
Alucinação em LLM é a resposta errada entregue com a mesma segurança da certa. Entenda por que o modelo inventa e quais técnicas, de RAG a verificação em camadas, reduzem o risco em aplicações reais.
Estudo com eBay propõe novo design de feedback para IA generativa
Paper publicado no arXiv em 2 de outubro de 2026, em colaboração com o eBay, mapeia falhas nos mecanismos de feedback de IA generativa e testa um protótipo para coletar avaliações de usuários de forma mais eficiente.
Vídeos em Destaque
Posts Populares
SR-OPD corta até 96% dos tokens de professor na destilação de LLMs
A técnica SR-OPD, apresentada em artigo no arXiv, usa rollouts bem-sucedidos do próprio aluno como referência para escolher quais falhas recebem supervisão do professor. Nos testes, consumiu entre 3,46% e 5,02% dos tokens de input exigidos pelo método tradicional, com desempenho de raciocínio comparável.
LLMs erram ao atualizar julgamento clínico, diz estudo no arXiv
Estudo no arXiv avaliou LLMs com trajetórias de UTI e encontrou dois modos de falha na revisão de julgamento clínico: reação mais forte à piora do que à melhora e ancoragem no risco prévio. O prompting não corrigiu o comportamento.
GraphMemory usa 85% menos tokens em memória de agentes LLM
Artigo no arXiv propõe o GraphMemory, memória em grafo que recupera apenas subgrafos relevantes por consulta e reduz em 81% a 85% os tokens de construção de memória em agentes de LLM.
Como escolher um modelo de IA para seu projeto sem estourar o custo
Escolher um modelo de IA pelo ranking de benchmark é o caminho mais rápido para estourar o orçamento. O guia mostra os critérios que realmente decidem: tarefa, custo por token, latência, licença e um teste com os seus próprios dados.
Seg-OPD: destilação por segmentos melhora raciocínio de LLMs
O Seg-OPD treina modelos de linguagem a revisar passos intermediários do próprio raciocínio usando redrafts do professor como supervisão. O método registrou ganho médio relativo de 5,22% em acurácia em tarefas de matemática e programação competitiva. É um preprint, sem revisão por pares.
OSSE-LSTM reduz rótulos em classificação de séries temporais
O Dual-Stream OSSE-LSTM, submetido ao arXiv em 2 de outubro de 2026, mantém acurácia entre 96,36% e 96,72% em 19 datasets do UCR com poucos rótulos por classe e supera baselines mesmo na pior configuração, com 93,99%.



