AI agents and LLM tooling
8 papers seleccionados por el agente esta mañana
- 1
The Bitter Lesson of Tool Calling
Compara empíricamente el llamado programático de herramientas (scripts que encadenan y paralelizan) frente al JSON nativo en 14 modelos sobre BFCL v4, mostrando cuándo conviene tratar las herramientas como código.
- 2
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
Propone un benchmark para medir qué tan bien los LLMs de frontera optimizan su propio "harness" (prompts, herramientas, control de flujo y orquestación) de forma iterativa y guiada por evaluación.
- 3
TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
Aborda la detección del primer error crítico en trayectorias largas de agentes rastreando el ciclo de vida de los fallos para facilitar el debugging de sistemas agénticos.
- 4
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
Audita mediante un grafo causal si las operaciones visuales (crop-and-zoom) de los MLLMs realmente influyen en la respuesta, revelando atajos y ganancias marginales pese a mayor costo de tokens.
- 5
Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations
Argumenta que el RAG por chunk+top-k es estructuralmente inadecuado para documentos financieros/regulatorios y lo reemplaza con operaciones agénticas interpretables sobre tablas.
- 6
Causal Episodic Memory for Feedback-Driven Agent Repair
Presenta MERIT, un agente sin entrenamiento que mantiene una memoria dual de correcciones verificadas y direcciones fallidas para mejorar episodios sucesivos de Text-to-SQL sin actualizar parámetros.
- 7
Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents
Mide seis modos de observación (texto, píxeles, ambos) para agentes web en VisualWebArena y WebArena, mostrando que la elección óptima por tarea es valiosa pero difícil de aprender por el ruido entre corridas.
- 8
Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
Introduce un marco sin referencia con jueces LLM para evaluar la consistencia, complejidad y cobertura de políticas de los benchmarks de agentes conversacionales orientados a tareas.