AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
The Bitter Lesson of Tool Calling
Comparan llamado de herramientas programático (scripts) contra JSON nativo en 14 modelos sobre BFCL v4, mostrando cuándo conviene cada paradigma.
- 2
HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
Un benchmark para medir qué tan bien los LLMs frontera mejoran automáticamente el "harness" (prompts, herramientas, orquestación) de sistemas agénticos.
- 3
TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories
Propone rastrear el ciclo de vida de errores para localizar el primer fallo crítico en trayectorias largas de agentes.
- 4
The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
Audita causalmente el paradigma "pensar con imágenes" y revela que las operaciones visuales suelen aportar ganancias marginales o negativas frente a la inferencia directa.
- 5
Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations
Sustituye el RAG por top-k con operaciones agénticas interpretables, argumentando que el chunking es estructuralmente inadecuado para documentos financieros y regulatorios.
- 6
Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents
Mide seis modos de observación para agentes web y muestra que el ruteo por tarea es justamente menos aprendible donde más valdría.
- 7
CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
Sistema que sintetiza tareas de terminal ejecutables y verificables, calibrándolas de forma adversarial según el comportamiento de solvers para que sean desafiantes pero aprendibles.
- 8
ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment
Asistente de salud agéntico desplegable localmente con bucle ReAct, 17 herramientas clínicas y memoria temporal, con 94.9% de éxito en ejecución de herramientas.
- 9
Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
Marco libre de referencia con jueces LLM para evaluar la consistencia, complejidad y cobertura de políticas de los propios benchmarks de agentes conversacionales.