AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
OpenForgeRL: Train Harness-native Agents in Any Environment
Framework open-source que entrena agentes basados en harnesses como Claude Code o Codex de punta a punta usando un proxy liviano que sirve las llamadas del modelo.
- 2
Euclid-MCP: A Model Context Protocol Server for Deterministic Logical Reasoning via Prolog
Servidor MCP open-source que dota a los agentes de razonamiento lógico determinista mediante SWI-Prolog y una representación intermedia agnóstica al motor.
- 3
MemTools: A Unified Research Framework for Interoperable Agent Memory
Framework que desacopla los componentes del ciclo de vida de memoria de sus entornos de despliegue para permitir investigación sistemática y sistemas de memoria intercambiables.
- 4
AREX: Towards a Recursively Self-Improving Agent for Deep Research
Familia de agentes de investigación profunda que refina recursivamente sus respuestas verificando resultados intermedios para satisfacer múltiples restricciones.
- 5
Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
Propone gestionar activamente el contexto del agente como un problema de ciclo de vida y arquitectura, no de mero almacenamiento y recuperación.
- 6
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
Suite de evaluación para agentes de código en cuatro dominios (Code, Web, Office, Security) con tareas ingenierizadas desde commits reales para resistir contaminación.
- 7
IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
Evaluación sistemática de la susceptibilidad de agentes de código LLM a issues maliciosos que inducen exfiltración de datos y compromiso del entorno.
- 8
Agentic coding without the cloud: evaluating open-weight LLMs on longitudinal data preparation tasks
Framework open-source para evaluar agentes con modelos de peso abierto desplegados localmente, evitando enviar datos sensibles a servicios cloud.
- 9
Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents
Argumenta que los agentes de largo plazo necesitan una memoria operativa anclada a señales del contexto y recuperada involuntariamente, integrada en el harness.