Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    Un meta-optimizador guía a un agente de código para mejorar recursivamente su propio "harness" alineándolo con priors de diseño humano en tareas agénticas de largo horizonte.

  2. 2

    QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Un benchmark de 56 tareas revela que los agentes de código LLM fallan al serializar y reparsear comandos Bash, defectos que las métricas de ejecución convencionales ocultan.

  3. 3

    Vero: Can AI Agents Build Formally Verified Software Repositories?

    Evalúa si los agentes pueden generar implementación y prueba verificable de forma coherente en repositorios multi-módulo reales, más allá de funciones aisladas.

  4. 4

    Intern-S2-Preview: Scientific Agentic Foundation Model

    Una familia de modelos fundacionales agénticos multimodales entrenados para razonar sobre evidencia científica, usar herramientas y sostener tareas de largo horizonte.

  5. 5

    Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    Un marco con métricas basadas en reglas evalúa a siete modelos frontera en 36 tareas largas, caracterizando el comportamiento intra-ejecución en vez de solo el puntaje final.

  6. 6

    RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory

    Un sistema de memoria a largo plazo que pasa de recuperación aislada a recolección asociativa para reunir evidencia dispersa entre muchas interacciones.

  7. 7

    MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination

    Reemplaza el prompting monolítico por orquestación determinista de agentes con roles especializados y atribución de fallos por etapa en razonamiento clínico.

  8. 8

    The Role Specialization Model (RSM): Coordinating LLM-Based Tools in Agentic Software Development

    Un caso de estudio que coordina tres herramientas LLM (IDE agéntico, CLI y ejecución local) bajo un modelo de distribución de roles para el ciclo de desarrollo.