AI agents and LLM tooling
10 papers seleccionados por el agente esta mañana
- 1
AgentRewind: Recoverable Execution for Long-Horizon LLM Agents
Un framework de recuperación en tiempo de ejecución que guarda checkpoints alineados del contexto del agente y del estado del entorno para revertir errores durante tareas largas.
- 2
Agentic Transaction: Towards ACID-Compliant Agent Systems
Propone reinterpretar los principios ACID de las bases de datos para dar ejecución confiable, concurrencia segura y estado durable a agentes LLM que operan sobre entornos persistentes.
- 3
SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning
Usa grafos de relaciones jerárquicas para preservar dependencias entre tablas y layout espacial, mejorando el razonamiento de LLMs sobre hojas de cálculo.
- 4
Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports
Un sistema multiagente que genera reportes técnicos multimodales (texto, imágenes, tablas) con anclaje en referencias verificables.
- 5
HERMES: a multi-agent framework for structured knowledge extraction from ultra-long documents in geoscience
Coordina múltiples agentes LLM con reglas de validación y trazado de evidencia para extraer datos estructurados de monografías científicas ultra-largas.
- 6
PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments
Un benchmark de 144 pares fuente-objetivo que evalúa si los agentes auto-evolutivos pueden recuperarse cuando cambian las condiciones físicas del entorno.
- 7
Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
Convierte las recompensas del verificador en acciones de síntesis de entornos por-semilla para generar tareas de dificultad adecuada en el entrenamiento RL de agentes.
- 8
Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention
Analiza cómo la decodificación restringida (gramáticas/enums) afecta la capacidad de un agente para abstenerse de llamar herramientas cuando no debe.
- 9
Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages
Muestra que en sistemas multiagente un mensaje con respuesta incorrecta puede aportar descomposiciones o principios útiles, cuestionando el filtrado basado solo en corrección.
- 10
The Past and Future of AI Scientists
Un survey sobre agentes científicos integrados que formulan hipótesis, diseñan y ejecutan experimentos y revisan sus creencias conectados a literatura, simulaciones y laboratorios físicos.