Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    The Bitter Lesson of Tool Calling

    El llamado programático de herramientas (scripts que encadenan y paralelizan) supera al JSON nativo en 14 modelos sobre BFCL v4, sobre todo en tareas reales complejas.

  2. 2

    HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

    Un benchmark para medir cuán bien los LLMs frontera optimizan su propio "harness" (prompts, herramientas, control de flujo, memoria y orquestación) en sistemas agénticos.

  3. 3

    EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

    Reemplaza la interacción con entornos ejecutables costosos por "ensayo del mundo", donde la política genera la llamada a herramienta y también simula la respuesta del entorno.

  4. 4

    TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

    Localiza el primer paso erróneo responsable del fallo final en trayectorias agénticas largas, rastreando el ciclo de vida de los errores en cascada.

  5. 5

    Comparative Approaches to Agent Retrieval over Large Skill Libraries

    Compara un ranker híbrido léxico-denso frente a un grafo de conocimiento tipado para decidir qué habilidades cargar (y en qué orden) de una biblioteca de 690 skills.

  6. 6

    Hardware Keystores for AI Agent Signing Workflows: A Zero-Trust MCP Enforcement Architecture

    Propone mover las claves privadas de los agentes a keystores de hardware con autorización consciente del contenido bajo una arquitectura zero-trust sobre MCP.

  7. 7

    The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

    Audita causalmente el paradigma "pensar con imágenes" y muestra que las operaciones visuales activas suelen dar ganancias marginales o negativas frente a la inferencia directa, a mayor costo de tokens.

  8. 8

    Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents

    Mide seis modos de observación (texto, píxeles, ambos) para agentes web y muestra que elegir el modo óptimo por tarea es valioso pero difícil de aprender por el ruido entre ejecuciones.