Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    OpenForgeRL: Train Harness-native Agents in Any Environment

    Framework open-source que entrena agentes basados en harnesses complejos (tipo Claude Code o Codex) de extremo a extremo mediante un proxy ligero que sirve las llamadas del modelo.

  2. 2

    AREX: Towards a Recursively Self-Improving Agent for Deep Research

    Familia de agentes de investigación profunda que refinan sus respuestas de forma recursiva verificando resultados intermedios para satisfacer múltiples restricciones.

  3. 3

    Agentic Context Management

    Propone tratar la memoria y el costo de los agentes como un problema de ciclo de vida y arquitectura, gestionando activamente historiales, prompts y salidas de herramientas en lugar de solo almacenarlos.

  4. 4

    Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

    Servidor MCP open-source que dota a agentes aumentados con herramientas de razonamiento lógico determinista vía SWI-Prolog con una representación intermedia agnóstica al motor.

  5. 5

    MemTools: A Unified Research Framework for Interoperable Agent Memory

    Framework que desacopla los componentes del ciclo de vida de la memoria mediante contratos de datos declarativos, permitiendo intercambiar y combinar sistemas de memoria heterogéneos.

  6. 6

    GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG

    Modela el pipeline RAG como un grafo computacional y propaga retroalimentación estructurada de un evaluador para adaptar prompts de agentes upstream de forma coordinada.

  7. 7

    Tencent WorkBuddy Bench

    Benchmark multi-dominio y resistente a contaminación para agentes de código que reconstruye cada tarea a partir de commits o PRs reales reescritos como pedidos coloquiales.

  8. 8

    IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

    Evaluación sistemática de los riesgos de seguridad de agentes de código autónomos frente a issues maliciosos que inducen exfiltración de datos o compromiso del entorno.

  9. 9

    LLMs Get Lost in Evolving User Intent

    Muestra que los LLM usados como agentes colaborativos rastrean mal la intención del usuario cuando esta se revela y revisa a lo largo de una conversación multi-turno.