Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

    Un benchmark de más de 8.000 APIs ejecutables en 62 dominios que mide el razonamiento multi-hop de agentes sobre APIs estructuradas y documentos bajo restricciones de política de uso de herramientas.

  2. 2

    ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

    Un framework escalable que sintetiza entornos adversariales para probar la resistencia de agentes LLM a inyecciones de prompt indirectas incrustadas en el estado del entorno.

  3. 3

    Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents

    Un ataque de solo texto que, sin alterar el resultado de la tarea, empuja al agente hacia trayectorias innecesariamente costosas explotando skills de terceros.

  4. 4

    Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

    Compara sistemas de memoria (Mem0, Hindsight, Mastra) frente a estrategias de referencia, mostrando que su costo de servicio no se predice fácilmente y no siempre justifica la precisión ganada.

  5. 5

    When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

    Identifica el "Argument Language Mismatch" en llamadas a APIs multilingües y revisa estrategias de post-entrenamiento como SFT para corregir argumentos generados en el idioma equivocado.

  6. 6

    Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

    Propone diagnosticar el tipo de fallo antes de reparar, ofreciendo interfaces de recuperación más estrechas para acciones inválidas, procedimientos faltantes o errores de formato.

  7. 7

    Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill

    Un sistema que genera papers completos de investigación como trece skills componibles dentro de un asistente de código existente, sin plataforma de agentes separada.

  8. 8

    Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

    Un sistema agéntico que usa la IA como instrumento científico para descubrir de forma autónoma los mecanismos que subyacen a las capacidades de los modelos.

  9. 9

    An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS

    Tres roles de agentes especializados modernizan código Fortran heredado a escala de producción bajo un oráculo de verificación exacto y pocas compuertas humanas.