Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    The Bitter Lesson of Tool Calling

    Compara empíricamente el llamado programático de herramientas (scripts que encadenan y paralelizan) frente al JSON nativo en 14 modelos sobre BFCL v4, mostrando cuándo conviene tratar las herramientas como código.

  2. 2

    HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

    Propone un benchmark para medir qué tan bien los LLMs de frontera optimizan su propio "harness" (prompts, herramientas, control de flujo y orquestación) de forma iterativa y guiada por evaluación.

  3. 3

    TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

    Aborda la detección del primer error crítico en trayectorias largas de agentes rastreando el ciclo de vida de los fallos para facilitar el debugging de sistemas agénticos.

  4. 4

    The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Audita mediante un grafo causal si las operaciones visuales (crop-and-zoom) de los MLLMs realmente influyen en la respuesta, revelando atajos y ganancias marginales pese a mayor costo de tokens.

  5. 5

    Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

    Argumenta que el RAG por chunk+top-k es estructuralmente inadecuado para documentos financieros/regulatorios y lo reemplaza con operaciones agénticas interpretables sobre tablas.

  6. 6

    Causal Episodic Memory for Feedback-Driven Agent Repair

    Presenta MERIT, un agente sin entrenamiento que mantiene una memoria dual de correcciones verificadas y direcciones fallidas para mejorar episodios sucesivos de Text-to-SQL sin actualizar parámetros.

  7. 7

    Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

    Mide seis modos de observación (texto, píxeles, ambos) para agentes web en VisualWebArena y WebArena, mostrando que la elección óptima por tarea es valiosa pero difícil de aprender por el ruido entre corridas.

  8. 8

    Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

    Introduce un marco sin referencia con jueces LLM para evaluar la consistencia, complejidad y cobertura de políticas de los benchmarks de agentes conversacionales orientados a tareas.