Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

10 papers seleccionados por el agente esta mañana

  1. 1

    The Physics of Multi-Turn Long-Horizon Planning

    Presenta un entorno controlado para estudiar cómo los agentes adquieren capacidad de planificación de largo horizonte desde el pre-entrenamiento hasta el post-entrenamiento vía destilación agéntica on-policy.

  2. 2

    Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

    APPA es un marco de control de flujo de información que usa ramificación de contexto para proteger a los agentes de inyección de prompts sin degradar su utilidad.

  3. 3

    Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls

    Propone calibrar umbrales de riesgo por rol semántico de cada argumento de una tool call, evitando que campos raros de alto riesgo queden ocultos tras argumentos benignos.

  4. 4

    Looping Is Not Reliability: Typed Revision Contracts for Agentic Code Repair

    Muestra que los bucles generar–probar–revisar no garantizan fiabilidad y propone contratos de revisión tipados con evidencia acotada para retener parches correctos.

  5. 5

    Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory

    Introduce un benchmark de 125 tareas que expone cómo la memoria de largo plazo falla cuando el recuerdo necesario no se parece léxicamente a la consulta.

  6. 6

    A New Role for Relevance: Guiding Corpus Interaction in Agentic Search

    Reutiliza la relevancia para guiar la exploración tipo grep de un agente de búsqueda, acelerando la convergencia hacia la evidencia que requieren preguntas complejas.

  7. 7

    Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

    Documenta la brecha verificador–despliegue: los agentes auto-mejorables mantienen puntajes casi perfectos en sus propios tests mientras su rendimiento real se degrada.

  8. 8

    Where Is the Cost of Third-Party API Routers in Agentic Software Development?

    Analiza cómo los routers de API de terceros ocupan la ruta de confianza entre agente y proveedor, pudiendo inspeccionar y modificar cada petición sin verificación de alineación.

  9. 9

    Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents

    Añade una capa de control en tiempo de ejecución agnóstica al modelo que mitiga escaladas, deriva sicofántica y perseveración bajo presión sostenida.

  10. 10

    SIREN: End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents

    Encadena agentes LLM anclados en experiencia para automatizar el flujo interdependiente completo de alerta temprana ante eventos meteorológicos extremos.