Auto-treinamento verificado: IA melhora com registros de governança
Pesquisa mostra que registros de governança de workflows podem treinar modelos de IA sem oracle ou teacher forte, elevando planos aceitos de 1 para 57 e reduzindo latência em 56x.
Pesquisa mostra que registros de governança de workflows podem treinar modelos de IA sem oracle ou teacher forte, elevando planos aceitos de 1 para 57 e reduzindo latência em 56x.
Artigo no arXiv mostra que rankings de IA falham com o Sul Global por falta de governança, não de dados. Estudo com a Índia propõe leaderboards regionais independentes.
Novo benchmark com 954 problemas de geometria olímpica mostra que modelos de IA como GPT e Claude têm apenas 36,14% de sucesso ao gerar diagramas, revelando uma lacuna entre raciocínio matemático e construção visual.
Revisão sistemática publicada no arXiv consolida o estado da arte da IA agêntica, cobrindo evolução, aplicações e fatores de adoção. Estudo propõe framework para orientar implementações.
Survey no arXiv propõe modelar agentes autoevolutivos como grafos dinâmicos, com quatro taxonomias e nove subcampos de aprendizado de grafos mapeados para capacidades de evolução.
ComponentBench, novo benchmark para agentes de uso de computador, mostra que a escolha do espaço de observação e ação pode mudar o sucesso em mais de 30% para o mesmo modelo, com GPT-5 mini caindo de 83,1% para 48,9%.
FinSkillBench, novo benchmark para agentes de IA em investimentos, mostra que skills curadas elevam desempenho em 44%, enquanto auto-geração falha. Estudo com 9 modelos foi submetido ao arXiv em junho de 2026.
Estudo propõe protótipo com IA que analisa logs de voo para detectar falhas em hélices de drones, usando seis indicadores de saúde e classificando gravidade para priorizar manutenção.
Position paper do arXiv defende que agentes de IA sejam avaliados como sistemas comportamentais, com testes que observam, perturbam e interpretam ações — não apenas resultados finais.
Revisão sistemática do arXiv mapeia usos de LLMs na saúde mental, incluindo detecção de depressão e risco de suicídio, e cobra regulação para implantação segura.