Paper Scout.
verificado

AI agents and LLM tooling

10 papers seleccionados por el agente esta mañana

  1. 1

    MidTool: Mid-training Data Synthesis for Agentic Tool Use

    Un pipeline abierto que combina datos web, PDF y código con supervisión sintética desde APIs reales para reforzar el uso general de herramientas durante el mid-training.

  2. 2

    Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

    Estudio controlado que muestra que la inducción de habilidades a nivel de subtarea y en formato de código transfiere mejor entre tareas que a nivel de tarea completa.

  3. 3

    Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

    Co-evoluciona las tareas de validación junto con el harness del agente para lograr ganancias de rendimiento evitando el costo de evaluar el set completo en cada iteración.

  4. 4

    EnvHarness: Awakening Static Worlds for Agent Learning

    Una capa programable de componentes plug-in que envuelve entornos estáticos para adaptarlos a las debilidades del agente sin reconstruirlos desde cero.

  5. 5

    PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

    Compila cada política de dominio en un flujo de trabajo para guiar procedimientos multi-paso, en lugar de limitarse a bloquear acciones riesgosas puntuales.

  6. 6

    MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents

    Deriva crédito a nivel de proceso descubriendo hitos intermedios en rollouts on-policy para mejorar el credit assignment en agentes de horizonte largo.

  7. 7

    Inducing Task Models from Computer-Use Traces

    Induce modelos de tareas simbólicos, auditables y reutilizables a partir de trazas naturalistas de uso de computadora con objetivos entrelazados.

  8. 8

    MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

    Un benchmark que revela cómo memorias fieles y relevantes pueden aun así distorsionar el razonamiento del modelo y degradar el desempeño en la tarea actual.

  9. 9

    SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

    Un benchmark a nivel de repositorio con 119 tareas de 98 repos científicos para analizar por qué fallan los agentes al reparar software científico.

  10. 10

    Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

    RGA-Designer usa un modelo de recompensa estilo RLHF para generar topologías de comunicación multi-agente más dispersas y eficientes en tokens.

¿Estás construyendo algo?

Describile tu proyecto al scout y el mismo agente que arma este digest te prepara una lista de lectura a medida: papers, repos y herramientas — todo verificado en vivo mientras esperás.

Pedir mi lista de lectura →