Prompt injection: o que é e como prevenir ataques em LLMs
Prompt injection explora a ausência de barreira entre instrução e dado em modelos de linguagem. Veja os tipos de ataque e as camadas de defesa que reduzem o risco.
Prompt injection explora a ausência de barreira entre instrução e dado em modelos de linguagem. Veja os tipos de ataque e as camadas de defesa que reduzem o risco.
Um estudo no arXiv testou se a geometria semântica de vetores bastaria para agentes de IA decidirem quais regras seguir. Em quatro experimentos, o julgamento pré-ação não se mostrou confiável. Um roteador lexical recuperou todas as políticas e cortou a mediana de checagens em 97,7%, mas o pipeline ainda escalou 2.304 ações, inclusive as permitidas.
Pesquisadores publicaram no arXiv um método que destila o conhecimento de agentes de IA diretamente nos pesos de modelos de difusão. O D-OPCD elevou a pontuação média de geração direta de 60,52 para 65,09 em quatro benchmarks e abriu caminho para coevolução contínua entre harness e modelo.
O MemMux, runtime local apresentado no arXiv, manteve uma frota de agentes de código dentro de 7,5 GiB de RAM e sem swap, enquanto ferramentas sem governança estouraram o teto e derramaram cerca de 2 GiB em swap. O sistema recupera 100% da subárvore de processos de um agente encerrado e detecta 10 de 10 processos escapados, mas consome 2,7% de CPU com dez agentes, acima da meta de 2%.
Planejador embutido no Nerveplane trata coordenação de agentes de código como escalonamento e leva a integração limpa de 1/9 para 9/9 cenários, cortando conflitos de merge de 13 para 0, segundo o paper arXiv:2610.07261v1.
Um novo framework do arXiv verifica se o score de um agente de IA foi realmente conquistado, reportado com honestidade e estável em cinco execuções. Aplicado a 108 tarefas do Agents' Last Exam, apenas 22,6% dos passes registrados passaram por todas as quatro checagens.
O artigo arXiv:2610.07309 propõe um framework que classifica cada par memória-consulta como admissível, inadmissível ou não resolvido. Nos benchmarks RHELM e MemOps, o recall das âncoras no top-20 sobe de 0,432 para 0,533 e as avaliações de similaridade exata caem 98,3%.
Levantamento no arXiv compara Datalog, answer set e probabilistic logic programs como camada simbólica de sistemas neurosimbólicos, analisando mais de 50 aplicações em bancos de dados, machine learning, visão e robótica.
O artigo arXiv 2610.07342v1 apresenta o RGPO, framework que usa justificativas de referência como andaimes temporários no aprendizado por reforço e transfere de volta apenas as soluções de maior recompensa geradas pelo próprio modelo. Os autores relatam ganhos sobre baselines de RLVR em cenários de linguagem e de visão e linguagem.
O artigo arXiv:2610.07350v1 apresenta o TLAR, método que recupera continuations do próprio histórico do modelo e as combina com rascunhos gerados em uma árvore de candidatos compartilhada. Testado em código, matemática e escrita aberta, o método eleva a aceitação de tokens e o throughput.