Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    The Bitter Lesson of Tool Calling

    Comparan llamado de herramientas programático (scripts) contra JSON nativo en 14 modelos sobre BFCL v4, mostrando cuándo conviene cada paradigma.

  2. 2

    HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

    Un benchmark para medir qué tan bien los LLMs frontera mejoran automáticamente el "harness" (prompts, herramientas, orquestación) de sistemas agénticos.

  3. 3

    TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

    Propone rastrear el ciclo de vida de errores para localizar el primer fallo crítico en trayectorias largas de agentes.

  4. 4

    The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Audita causalmente el paradigma "pensar con imágenes" y revela que las operaciones visuales suelen aportar ganancias marginales o negativas frente a la inferencia directa.

  5. 5

    Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations

    Sustituye el RAG por top-k con operaciones agénticas interpretables, argumentando que el chunking es estructuralmente inadecuado para documentos financieros y regulatorios.

  6. 6

    Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

    Mide seis modos de observación para agentes web y muestra que el ruteo por tarea es justamente menos aprendible donde más valdría.

  7. 7

    CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

    Sistema que sintetiza tareas de terminal ejecutables y verificables, calibrándolas de forma adversarial según el comportamiento de solvers para que sean desafiantes pero aprendibles.

  8. 8

    ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

    Asistente de salud agéntico desplegable localmente con bucle ReAct, 17 herramientas clínicas y memoria temporal, con 94.9% de éxito en ejecución de herramientas.

  9. 9

    Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

    Marco libre de referencia con jueces LLM para evaluar la consistencia, complejidad y cobertura de políticas de los propios benchmarks de agentes conversacionales.