AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies
Un benchmark de más de 8.000 APIs ejecutables en 62 dominios que mide el razonamiento multi-hop de agentes sobre APIs estructuradas y documentos bajo restricciones de política de uso de herramientas.
- 2
ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents
Un framework escalable que sintetiza entornos adversariales para probar la resistencia de agentes LLM a inyecciones de prompt indirectas incrustadas en el estado del entorno.
- 3
Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents
Un ataque de solo texto que, sin alterar el resultado de la tarea, empuja al agente hacia trayectorias innecesariamente costosas explotando skills de terceros.
- 4
Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems
Compara sistemas de memoria (Mem0, Hindsight, Mastra) frente a estrategias de referencia, mostrando que su costo de servicio no se predice fácilmente y no siempre justifica la precisión ganada.
- 5
When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use
Identifica el "Argument Language Mismatch" en llamadas a APIs multilingües y revisa estrategias de post-entrenamiento como SFT para corregir argumentos generados en el idioma equivocado.
- 6
Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction
Propone diagnosticar el tipo de fallo antes de reparar, ofreciendo interfaces de recuperación más estrechas para acciones inválidas, procedimientos faltantes o errores de formato.
- 7
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill
Un sistema que genera papers completos de investigación como trece skills componibles dentro de un asistente de código existente, sin plataforma de agentes separada.
- 8
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence
Un sistema agéntico que usa la IA como instrumento científico para descubrir de forma autónoma los mecanismos que subyacen a las capacidades de los modelos.
- 9
An Agentic Workflow for Legacy HPC Modernization: Converting the Two-Electron-Integral Core of GAMESS
Tres roles de agentes especializados modernizan código Fortran heredado a escala de producción bajo un oráculo de verificación exacto y pocas compuertas humanas.