Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent

    Propone refinar las "skills" textuales reutilizables de los agentes LLM mediante gradientes proximales en el espacio del texto, con diagnóstico explícito y borrado como mecanismo de consolidación.

  2. 2

    PsychoAgent: An Affect-Sensitive Cognitive Architecture for Conflict-Aware Memory in LLM Agents

    Separa memoria factual y afectiva y las integra vía un controlador ejecutivo que reordena recuerdos por saliencia emocional, mejorando la recuperación en escenarios de conflicto.

  3. 3

    TEPA: Revoking Stale Memories for Conflict-Robust Language Agents

    Introduce una memoria de evidencia revocable que convierte la validez en un estado explícito, revocando precedentes cuando nueva evidencia los contradice para evitar la "contaminación" del prompt.

  4. 4

    Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing

    Muestra que los agentes cometen errores inferenciales sutiles pese a ejecutar bien el análisis, y presenta P-Bench junto con entrenamiento para que los p-values reportados sean estadísticamente válidos.

  5. 5

    An End-to-End Agent Auditing Engine (A²E)

    Presenta un motor de evaluación de extremo a extremo para "harnesses" de agentes basado en un Agent Task Protocol que permite auditorías sistemáticas y comprensivas de sus capacidades.

  6. 6

    Blast Radius

    Propone una capa predictiva de gestión de memoria para coding agentico que estima el alcance de cada prompt y permite desalojo reversible de contexto muerto para reducir el desperdicio de tokens.

  7. 7

    Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning (TRIAL)

    Asigna señales de hindsight turno a turno usando la diferencia de log-probabilidad entre contextos ordinarios y condicionados por hindsight, mejorando el crédito en RL agentico con recompensas escasas.

  8. 8

    Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution

    Combina planificación evolutiva y memoria episódica para agentes que resuelven issues reales de software en trayectorias largas, verificando con evidencia de ejecución en lugar de afirmaciones del propio agente.

  9. 9

    AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

    Ofrece un framework de ingeniería del caos con una taxonomía de fallos de las APIs LLM (errores del servidor, respuestas truncadas o corruptas) para evaluar la robustez de sistemas de agentes.