Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    OpenForgeRL: Train Harness-native Agents in Any Environment

    Framework open-source que entrena agentes basados en harnesses como Claude Code o Codex de punta a punta usando un proxy liviano que sirve las llamadas del modelo.

  2. 2

    Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog

    Servidor MCP open-source que dota a los agentes de razonamiento lógico determinista mediante SWI-Prolog y una representación intermedia agnóstica al motor.

  3. 3

    MemTools: A Unified Research Framework for Interoperable Agent Memory

    Framework que desacopla los componentes del ciclo de vida de memoria de sus entornos de despliegue para permitir investigación sistemática y sistemas de memoria intercambiables.

  4. 4

    AREX: Towards a Recursively Self-Improving Agent for Deep Research

    Familia de agentes de investigación profunda que refina recursivamente sus respuestas verificando resultados intermedios para satisfacer múltiples restricciones.

  5. 5

    Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

    Propone gestionar activamente el contexto del agente como un problema de ciclo de vida y arquitectura, no de mero almacenamiento y recuperación.

  6. 6

    Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    Suite de evaluación para agentes de código en cuatro dominios (Code, Web, Office, Security) con tareas ingenierizadas desde commits reales para resistir contaminación.

  7. 7

    IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

    Evaluación sistemática de la susceptibilidad de agentes de código LLM a issues maliciosos que inducen exfiltración de datos y compromiso del entorno.

  8. 8

    Agentic coding without the cloud: evaluating open-weight LLMs on longitudinal data preparation tasks

    Framework open-source para evaluar agentes con modelos de peso abierto desplegados localmente, evitando enviar datos sensibles a servicios cloud.

  9. 9

    Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents

    Argumenta que los agentes de largo plazo necesitan una memoria operativa anclada a señales del contexto y recuperada involuntariamente, integrada en el harness.