AI agents and LLM tooling
10 papers seleccionados por el agente esta mañana
- 1
The Physics of Multi-Turn Long-Horizon Planning
Presenta un entorno controlado para estudiar cómo los agentes adquieren capacidad de planificación de largo horizonte desde el pre-entrenamiento hasta el post-entrenamiento vía destilación agéntica on-policy.
- 2
Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents
APPA es un marco de control de flujo de información que usa ramificación de contexto para proteger a los agentes de inyección de prompts sin degradar su utilidad.
- 3
Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls
Propone calibrar umbrales de riesgo por rol semántico de cada argumento de una tool call, evitando que campos raros de alto riesgo queden ocultos tras argumentos benignos.
- 4
Looping Is Not Reliability: Typed Revision Contracts for Agentic Code Repair
Muestra que los bucles generar–probar–revisar no garantizan fiabilidad y propone contratos de revisión tipados con evidencia acotada para retener parches correctos.
- 5
Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory
Introduce un benchmark de 125 tareas que expone cómo la memoria de largo plazo falla cuando el recuerdo necesario no se parece léxicamente a la consulta.
- 6
A New Role for Relevance: Guiding Corpus Interaction in Agentic Search
Reutiliza la relevancia para guiar la exploración tipo grep de un agente de búsqueda, acelerando la convergencia hacia la evidencia que requieren preguntas complejas.
- 7
Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents
Documenta la brecha verificador–despliegue: los agentes auto-mejorables mantienen puntajes casi perfectos en sus propios tests mientras su rendimiento real se degrada.
- 8
Where Is the Cost of Third-Party API Routers in Agentic Software Development?
Analiza cómo los routers de API de terceros ocupan la ruta de confianza entre agente y proveedor, pudiendo inspeccionar y modificar cada petición sin verificación de alineación.
- 9
Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents
Añade una capa de control en tiempo de ejecución agnóstica al modelo que mitiga escaladas, deriva sicofántica y perseveración bajo presión sostenida.
- 10
SIREN: End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents
Encadena agentes LLM anclados en experiencia para automatizar el flujo interdependiente completo de alerta temprana ante eventos meteorológicos extremos.