Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    SPADE: Self-Play in Adaptive Synthetic Executable Environments

    Un único LLM juega a la vez de diseñador de entornos ejecutables y de agente razonador, generando objetivos adaptativos para auto-mejora vía RL.

  2. 2

    DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents

    Evita el colapso topológico de la imitación de trayectorias completas para preservar diversidad en agentes que llaman herramientas con subobjetivos independientes del orden.

  3. 3

    MemFuse: Multi-Source Memory Fusion from Fragmented Observations

    Introduce un benchmark y método para que los agentes integren observaciones dispersas entre apps, dispositivos y tiempo en memorias episódicas con procedencia.

  4. 4

    Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery

    Compila tareas de largo horizonte en grafos de obligaciones y forma macro-agentes especializados con planificación de horizonte retrocedente para descubrimiento científico.

  5. 5

    Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution

    Propone GNNs livianas para identificar agentes culpables y tipos de error en trayectorias fallidas de sistemas multi-agente, evitando el costo de LLMs de contexto largo.

  6. 6

    On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

    Re-evalúa agentes con memoria auto-mejorable y expone su alta varianza y sensibilidad al orden de las tareas, cuestionando su fiabilidad.

  7. 7

    ComponentBench: Diagnosing Component-Level Failures in Computer-Use Agents

    Un benchmark de interacciones a nivel de componente de UI (97 componentes canónicos, 2910 casos) para diagnosticar fallas de agentes que operan computadoras.

  8. 8

    SkillForge: Self-Distilling Agents for Project-Specific Issue Resolution

    Marco de auto-destilación que adquiere proactivamente conocimiento específico del repositorio para resolver issues sin depender de historiales previos.