Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

10 papers seleccionados por el agente esta mañana

  1. 1

    AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

    Un framework de recuperación en tiempo de ejecución que guarda checkpoints alineados del contexto del agente y del estado del entorno para revertir errores durante tareas largas.

  2. 2

    Agentic Transaction: Towards ACID-Compliant Agent Systems

    Propone reinterpretar los principios ACID de las bases de datos para dar ejecución confiable, concurrencia segura y estado durable a agentes LLM que operan sobre entornos persistentes.

  3. 3

    SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning

    Usa grafos de relaciones jerárquicas para preservar dependencias entre tablas y layout espacial, mejorando el razonamiento de LLMs sobre hojas de cálculo.

  4. 4

    Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports

    Un sistema multiagente que genera reportes técnicos multimodales (texto, imágenes, tablas) con anclaje en referencias verificables.

  5. 5

    HERMES: a multi-agent framework for structured knowledge extraction from ultra-long documents in geoscience

    Coordina múltiples agentes LLM con reglas de validación y trazado de evidencia para extraer datos estructurados de monografías científicas ultra-largas.

  6. 6

    PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

    Un benchmark de 144 pares fuente-objetivo que evalúa si los agentes auto-evolutivos pueden recuperarse cuando cambian las condiciones físicas del entorno.

  7. 7

    Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

    Convierte las recompensas del verificador en acciones de síntesis de entornos por-semilla para generar tareas de dificultad adecuada en el entrenamiento RL de agentes.

  8. 8

    Repair, Not Improvement: Decomposing Constrained Decoding in Tool-Call Abstention

    Analiza cómo la decodificación restringida (gramáticas/enums) afecta la capacidad de un agente para abstenerse de llamar herramientas cuando no debe.

  9. 9

    Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

    Muestra que en sistemas multiagente un mensaje con respuesta incorrecta puede aportar descomposiciones o principios útiles, cuestionando el filtrado basado solo en corrección.

  10. 10

    The Past and Future of AI Scientists

    Un survey sobre agentes científicos integrados que formulan hipótesis, diseñan y ejecutan experimentos y revisan sus creencias conectados a literatura, simulaciones y laboratorios físicos.