AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
SkillProx: Self-Evolving Agent Skills via Proximal Textual Gradient Descent
Propone refinar las "skills" textuales reutilizables de los agentes LLM mediante gradientes proximales en el espacio del texto, con diagnóstico explícito y borrado como mecanismo de consolidación.
- 2
PsychoAgent: An Affect-Sensitive Cognitive Architecture for Conflict-Aware Memory in LLM Agents
Separa memoria factual y afectiva y las integra vía un controlador ejecutivo que reordena recuerdos por saliencia emocional, mejorando la recuperación en escenarios de conflicto.
- 3
TEPA: Revoking Stale Memories for Conflict-Robust Language Agents
Introduce una memoria de evidencia revocable que convierte la validez en un estado explícito, revocando precedentes cuando nueva evidencia los contradice para evitar la "contaminación" del prompt.
- 4
Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing
Muestra que los agentes cometen errores inferenciales sutiles pese a ejecutar bien el análisis, y presenta P-Bench junto con entrenamiento para que los p-values reportados sean estadísticamente válidos.
- 5
An End-to-End Agent Auditing Engine (A²E)
Presenta un motor de evaluación de extremo a extremo para "harnesses" de agentes basado en un Agent Task Protocol que permite auditorías sistemáticas y comprensivas de sus capacidades.
- 6
Blast Radius
Propone una capa predictiva de gestión de memoria para coding agentico que estima el alcance de cada prompt y permite desalojo reversible de contexto muerto para reducir el desperdicio de tokens.
- 7
Trajectory-Relative Hindsight Distillation for Agentic Reinforcement Learning (TRIAL)
Asigna señales de hindsight turno a turno usando la diferencia de log-probabilidad entre contextos ordinarios y condicionados por hindsight, mejorando el crédito en RL agentico con recompensas escasas.
- 8
Coupling Planning with Episodic Memory in LLM Agents for Software Issue Resolution
Combina planificación evolutiva y memoria episódica para agentes que resuelven issues reales de software en trayectorias largas, verificando con evidencia de ejecución en lugar de afirmaciones del propio agente.
- 9
AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection
Ofrece un framework de ingeniería del caos con una taxonomía de fallos de las APIs LLM (errores del servidor, respuestas truncadas o corruptas) para evaluar la robustez de sistemas de agentes.