AI agents and LLM tooling
9 papers seleccionados por el agente esta mañana
- 1
Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?
Nuevo benchmark que aísla si los agentes de uso de computadora reconstruyen la transición causal provocada por una acción, más allá del éxito de la tarea.
- 2
MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents
Sistema de memoria consciente del valor que trata los registros como objetos de primera clase para evitar acumular información redundante y de bajo impacto.
- 3
UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams
Memoria híbrida episódica-a-paramétrica inspirada en el cerebro que resuelve el dilema estabilidad-plasticidad en flujos de tareas cambiantes.
- 4
Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks
Propone AgentToolMO, un modelo de información 3GPP para gestionar la confianza de herramientas invocadas por agentes a través de fronteras entre proveedores.
- 5
Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation
Corpus unificado de 957K registros que abarca 30 benchmarks y 714 agentes para hacer comparables las evaluaciones de agentes hoy fragmentadas.
- 6
Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification
Agente de recompensa que verifica estados del entorno (configuraciones, archivos, ajustes) para juzgar de forma fiable si un agente GUI completó la instrucción.
- 7
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
Benchmark de 1.151 tareas que mide si los agentes empresariales eligen primero la fuente de conocimiento correcta (documentos, tablas o grafos).
- 8
HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
65 tareas que prueban si un documento de políticas largo y vinculante realmente restringe el comportamiento del agente a lo largo de un horizonte extendido de uso de herramientas.
- 9
PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents
Evalúa agentes de salud orientados al paciente que conversan, razonan sobre historiales y actúan con un sandbox de herramientas clínicas.