AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
OpenForgeRL: Train Harness-native Agents in Any Environment
Framework open-source que entrena agentes basados en harnesses complejos (tipo Claude Code o Codex) de extremo a extremo mediante un proxy ligero que sirve las llamadas del modelo.
- 2
AREX: Towards a Recursively Self-Improving Agent for Deep Research
Familia de agentes de investigación profunda que refinan sus respuestas de forma recursiva verificando resultados intermedios para satisfacer múltiples restricciones.
- 3
Agentic Context Management
Propone tratar la memoria y el costo de los agentes como un problema de ciclo de vida y arquitectura, gestionando activamente historiales, prompts y salidas de herramientas en lugar de solo almacenarlos.
- 4
Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog
Servidor MCP open-source que dota a agentes aumentados con herramientas de razonamiento lógico determinista vía SWI-Prolog con una representación intermedia agnóstica al motor.
- 5
MemTools: A Unified Research Framework for Interoperable Agent Memory
Framework que desacopla los componentes del ciclo de vida de la memoria mediante contratos de datos declarativos, permitiendo intercambiar y combinar sistemas de memoria heterogéneos.
- 6
GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG
Modela el pipeline RAG como un grafo computacional y propaga retroalimentación estructurada de un evaluador para adaptar prompts de agentes upstream de forma coordinada.
- 7
Tencent WorkBuddy Bench
Benchmark multi-dominio y resistente a contaminación para agentes de código que reconstruye cada tarea a partir de commits o PRs reales reescritos como pedidos coloquiales.
- 8
IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
Evaluación sistemática de los riesgos de seguridad de agentes de código autónomos frente a issues maliciosos que inducen exfiltración de datos o compromiso del entorno.
- 9
LLMs Get Lost in Evolving User Intent
Muestra que los LLM usados como agentes colaborativos rastrean mal la intención del usuario cuando esta se revela y revisa a lo largo de una conversación multi-turno.