AI agents and LLM tooling
8 papers seleccionados por el agente esta mañana
- 1
MidTool: Mid-training Data Synthesis for Agentic Tool Use
Propone un pipeline abierto de mid-training que combina datos web, PDF y código con supervisión sintetizada desde APIs reales para reforzar el uso general de herramientas en agentes.
- 2
Inducing Task Models from Computer-Use Traces
Deriva modelos de tareas simbólicos, auditables y reutilizables a partir de trazas pasivas de pantalla y teclado/ratón, útiles para agentes de computer-use en trabajo real.
- 3
Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents
Estudia de forma controlada cómo la manera de inducir habilidades (nivel tarea vs. subtarea, texto vs. código) determina si transfieren de forma fiable entre tareas.
- 4
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
Co-evoluciona las tareas de validación con el harness del agente para recortar drásticamente el costo de la optimización iterativa sin tocar los pesos del modelo.
- 5
EnvHarness: Awakening Static Worlds for Agent Learning
Introduce una capa programable de componentes plug-in que envuelve entornos estáticos para remodelar su comportamiento y adaptarlos al aprendizaje del agente sin reconstruirlos.
- 6
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
Presenta un benchmark que aísla la capacidad de los agentes para diseñar algoritmos de entrenamiento, clave para evaluar la auto-mejora recursiva.
- 7
MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
Identifica y mide "trampas cognitivas" en las que memorias fieles y relevantes distorsionan el razonamiento del modelo y degradan el desempeño en la tarea actual.
- 8
From Agent Behaviour to Agent-Friendly Documentation
Estudio empírico de cómo los agentes de código descubren, leen y escriben documentación técnica, con hallazgos que cuestionan las prácticas actuales de documentación.