AI agents and LLM tooling
8 papers seleccionados por el agente esta mañana
- 1
SPADE: Self-Play in Adaptive Synthetic Executable Environments
Un único LLM juega a la vez de diseñador de entornos ejecutables y de agente razonador, generando objetivos adaptativos para auto-mejora vía RL.
- 2
DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
Evita el colapso topológico de la imitación de trayectorias completas para preservar diversidad en agentes que llaman herramientas con subobjetivos independientes del orden.
- 3
MemFuse: Multi-Source Memory Fusion from Fragmented Observations
Introduce un benchmark y método para que los agentes integren observaciones dispersas entre apps, dispositivos y tiempo en memorias episódicas con procedencia.
- 4
Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery
Compila tareas de largo horizonte en grafos de obligaciones y forma macro-agentes especializados con planificación de horizonte retrocedente para descubrimiento científico.
- 5
Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution
Propone GNNs livianas para identificar agentes culpables y tipos de error en trayectorias fallidas de sistemas multi-agente, evitando el costo de LLMs de contexto largo.
- 6
On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification
Re-evalúa agentes con memoria auto-mejorable y expone su alta varianza y sensibilidad al orden de las tareas, cuestionando su fiabilidad.
- 7
ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents
Un benchmark de interacciones a nivel de componente de UI (97 componentes canónicos, 2910 casos) para diagnosticar fallas de agentes que operan computadoras.
- 8
SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution
Marco de auto-destilación que adquiere proactivamente conocimiento específico del repositorio para resolver issues sin depender de historiales previos.