Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

    Nuevo benchmark que aísla si los agentes de uso de computadora reconstruyen la transición causal provocada por una acción, más allá del éxito de la tarea.

  2. 2

    MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents

    Sistema de memoria consciente del valor que trata los registros como objetos de primera clase para evitar acumular información redundante y de bajo impacto.

  3. 3

    UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams

    Memoria híbrida episódica-a-paramétrica inspirada en el cerebro que resuelve el dilema estabilidad-plasticidad en flujos de tareas cambiantes.

  4. 4

    Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks

    Propone AgentToolMO, un modelo de información 3GPP para gestionar la confianza de herramientas invocadas por agentes a través de fronteras entre proveedores.

  5. 5

    Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

    Corpus unificado de 957K registros que abarca 30 benchmarks y 714 agentes para hacer comparables las evaluaciones de agentes hoy fragmentadas.

  6. 6

    Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification

    Agente de recompensa que verifica estados del entorno (configuraciones, archivos, ajustes) para juzgar de forma fiable si un agente GUI completó la instrucción.

  7. 7

    WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

    Benchmark de 1.151 tareas que mide si los agentes empresariales eligen primero la fuente de conocimiento correcta (documentos, tablas o grafos).

  8. 8

    HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following

    65 tareas que prueban si un documento de políticas largo y vinculante realmente restringe el comportamiento del agente a lo largo de un horizonte extendido de uso de herramientas.

  9. 9

    PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

    Evalúa agentes de salud orientados al paciente que conversan, razonan sobre historiales y actúan con un sandbox de herramientas clínicas.