Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

10 papers seleccionados por el agente esta mañana

  1. 1

    Qwen-CUA: Native Computer Use for (almost) Everything

    Agente de uso de computadora con backbone MoE de 397B que opera cualquier software solo desde capturas de pantalla y eventos de teclado/mouse, sin DOM ni APIs.

  2. 2

    SWE-Touch: Benchmarking Coding Agents When Users Touch the Code

    Benchmark que estresa a los agentes de código en espacios compartidos donde el usuario edita el código durante la tarea, mediante "Counter-Edits" validados.

  3. 3

    Real-Time Detection and Repair of LLM Agent Failures

    Monitores de bajo costo (microsegundos por paso) entrenados solo con ejecuciones sanas detectan bucles, cascadas de errores de herramientas y desvíos de objetivo en pleno episodio.

  4. 4

    ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step

    Benchmark de terminal interactivo que elimina pistas semánticas de las herramientas para aislar el razonamiento conductual y la exploración autónoma.

  5. 5

    IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation

    Framework que combina gestión de contexto según intención y RL para invocaciones de herramientas de largo horizonte bajo ruido de intención dinámica.

  6. 6

    HarnessCompass: Guiding Automatic Harness Evolution toward Generalizable and Effective Agent Harnesses

    Evolución automática y restringida del "harness" del agente que optimiza componentes por separado para evitar interferencias y sobreajuste.

  7. 7

    PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

    Benchmark de diálogo orientado a tareas que introduce ruido controlado en las salidas de herramientas para medir robustez en dominios de alto riesgo.

  8. 8

    Token-Native Storage: Read and Write in your Agent's Language

    Propone almacenar texto directamente como IDs de tokens BPE del modelo, logrando 2.25× menos tamaño y menos costo de traducción para agentes lectores/escritores.

  9. 9

    RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory

    Memoria auto-evolutiva para agentes que usa estados de utilidad de orden reducido para evitar la dispersión de recompensas y la trampa memoria-recompensa.

  10. 10

    Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

    CoPES aplica estrategias de evolución en subespacios de parámetros para post-entrenar agentes con herramientas sin backpropagation en entornos con pocas GPUs.