Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

    Mejora el razonamiento con herramientas asignando crédito a nivel de turno vía auto-destilación hindsight, superando la supervisión por trayectoria en tareas de largo horizonte.

  2. 2

    Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

    Extiende los agentes de investigación de imágenes estáticas a video continuo con un pipeline desacoplado de percepción-exploración que combate el sesgo de modalidad y la fuga de conocimiento paramétrico.

  3. 3

    ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

    Un benchmark dinámico de cinco dominios revela que las librerías de habilidades de los agentes rara vez evolucionan de forma que realmente mejore la resolución de tareas.

  4. 4

    PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

    Aísla si la experiencia retenida entre sesiones mejora de verdad a los agentes personales, comparando condiciones con y sin memoria activada.

  5. 5

    Self-Evolving Coding Agents

    Repasa el creciente cuerpo de trabajo sobre agentes de código que actualizan su framework, memoria y estrategias a partir del feedback de repositorios, tests y reparaciones.

  6. 6

    MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents

    Presenta un ataque de envenenamiento de memoria que sigue siendo efectivo incluso con grandes pools benignos y auditoría activa de entradas.

  7. 7

    Resume Means Resume: A Machine-Checked Conformance Contract for Workflow Persistence

    Formaliza en TLA+ seis propiedades de checkpoint/interrupción/reanudación y muestra que cinco frameworks de agentes populares las violan.

  8. 8

    From Bug Reports to Browser-Executable Procedures: An LLM-Driven Agent for Web GUI Bug Reproduction

    ReBug reconstruye, ejecuta y valida procedimientos de reproducción de bugs de GUI web manejando un navegador real en dos etapas.

  9. 9

    An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

    Deriva una taxonomía de fallos de planificación en sistemas multiagente que empeoran a medida que baja la disponibilidad de recursos lingüísticos.