Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    Intern-S2-Preview: Scientific Agentic Foundation Model

    Serie de modelos fundacionales agénticos multimodales que razonan sobre evidencia científica, usan herramientas y sostienen tareas científicas de largo horizonte.

  2. 2

    Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI R&D

    Evalúa siete modelos frontera en 36 tareas de largo horizonte con métricas de comportamiento intra-ejecución más allá del puntaje final.

  3. 3

    AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    Un optimizador de meta-harness guía a un agente de código para mejorar recursivamente su andamiaje y acumular experiencia reutilizable.

  4. 4

    Vero: Can AI Agents Build Formally Verified Software Repositories?

    Benchmark que mide si los agentes pueden generar implementación y prueba verificable coherentes a través de repos multi-módulo reales.

  5. 5

    QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Aísla fallos de agentes de código introducidos por el transporte de ejecución (serialización/reparseo de Bash) frente a errores de generación.

  6. 6

    RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory

    Memoria de largo plazo que pasa de la recuperación aislada a la recolección asociativa para recuperar el conjunto correcto de evidencia.

  7. 7

    When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs

    ReFind muestra que un bucle iterativo de búsqueda léxica sobre logs crudos rivaliza con la memoria estructurada costosa.

  8. 8

    MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning

    Orquestación multi-agente determinista con paso explícito de contexto y atribución de fallos por etapa para razonamiento clínico.