AI agents and LLM tooling
10 papers seleccionados por el agente esta mañana
- 1
MidTool: Mid-training Data Synthesis for Agentic Tool Use
Un pipeline abierto que combina datos web, PDF y código con supervisión sintética desde APIs reales para reforzar el uso general de herramientas durante el mid-training.
- 2
Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents
Estudio controlado que muestra que la inducción de habilidades a nivel de subtarea y en formato de código transfiere mejor entre tareas que a nivel de tarea completa.
- 3
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
Co-evoluciona las tareas de validación junto con el harness del agente para lograr ganancias de rendimiento evitando el costo de evaluar el set completo en cada iteración.
- 4
EnvHarness: Awakening Static Worlds for Agent Learning
Una capa programable de componentes plug-in que envuelve entornos estáticos para adaptarlos a las debilidades del agente sin reconstruirlos desde cero.
- 5
PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents
Compila cada política de dominio en un flujo de trabajo para guiar procedimientos multi-paso, en lugar de limitarse a bloquear acciones riesgosas puntuales.
- 6
MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents
Deriva crédito a nivel de proceso descubriendo hitos intermedios en rollouts on-policy para mejorar el credit assignment en agentes de horizonte largo.
- 7
Inducing Task Models from Computer-Use Traces
Induce modelos de tareas simbólicos, auditables y reutilizables a partir de trazas naturalistas de uso de computadora con objetivos entrelazados.
- 8
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
Un benchmark que revela cómo memorias fieles y relevantes pueden aun así distorsionar el razonamiento del modelo y degradar el desempeño en la tarea actual.
- 9
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
Un benchmark a nivel de repositorio con 119 tareas de 98 repos científicos para analizar por qué fallan los agentes al reparar software científico.
- 10
Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design
RGA-Designer usa un modelo de recompensa estilo RLHF para generar topologías de comunicación multi-agente más dispersas y eficientes en tokens.