AI agents and LLM tooling
10 papers seleccionados por el agente esta mañana
- 1
Qwen-CUA: Native Computer Use for (almost) Everything
Agente de uso de computadora con backbone MoE de 397B que opera cualquier software solo desde capturas de pantalla y eventos de teclado/mouse, sin DOM ni APIs.
- 2
SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
Benchmark que estresa a los agentes de código en espacios compartidos donde el usuario edita el código durante la tarea, mediante "Counter-Edits" validados.
- 3
Real-Time Detection and Repair of LLM Agent Failures
Monitores de bajo costo (microsegundos por paso) entrenados solo con ejecuciones sanas detectan bucles, cascadas de errores de herramientas y desvíos de objetivo en pleno episodio.
- 4
ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step
Benchmark de terminal interactivo que elimina pistas semánticas de las herramientas para aislar el razonamiento conductual y la exploración autónoma.
- 5
IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation
Framework que combina gestión de contexto según intención y RL para invocaciones de herramientas de largo horizonte bajo ruido de intención dinámica.
- 6
HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses
Evolución automática y restringida del "harness" del agente que optimiza componentes por separado para evitar interferencias y sobreajuste.
- 7
PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise
Benchmark de diálogo orientado a tareas que introduce ruido controlado en las salidas de herramientas para medir robustez en dominios de alto riesgo.
- 8
Token-Native Storage: Read and Write in your Agent's Language
Propone almacenar texto directamente como IDs de tokens BPE del modelo, logrando 2.25× menos tamaño y menos costo de traducción para agentes lectores/escritores.
- 9
RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory
Memoria auto-evolutiva para agentes que usa estados de utilidad de orden reducido para evitar la dispersión de recompensas y la trampa memoria-recompensa.
- 10
Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training
CoPES aplica estrategias de evolución en subespacios de parámetros para post-entrenar agentes con herramientas sin backpropagation en entornos con pocas GPUs.