Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    Intern-S2-Preview: Scientific Agentic Foundation Model

    Serie de modelos fundacionales multimodales diseñados para razonar sobre evidencia científica, usar herramientas y sostener tareas de horizonte largo.

  2. 2

    AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

    Un meta-optimizador de "harness" guía a un agente de código para mejorar recursivamente su propio andamiaje en procesos agénticos de horizonte largo.

  3. 3

    Vero: Can AI Agents Build Formally Verified Software Repositories?

    Un benchmark que evalúa si los agentes pueden producir implementación y prueba verificada de forma coherente en bases de código reales multi-módulo.

  4. 4

    RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory

    Sistema de memoria a largo plazo que pasa de recuperación aislada a recolección asociativa para recuperar evidencia dispersa entre muchas interacciones.

  5. 5

    Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development

    Marco de evaluación con métricas basadas en reglas que analiza el comportamiento interno de agentes en 36 tareas de I+D de horizonte largo, más allá del puntaje final.

  6. 6

    QuoteBench: How Matched Scores Can Hide Command-Path Failures

    Benchmark que distingue errores de generación de comandos Bash de fallos introducidos por el transporte de ejecución en agentes de código LLM.

  7. 7

    MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning and Coordination

    Framework open-source que reemplaza el prompting monolítico por orquestación multi-agente determinista con paso explícito de contexto y atribución de fallos por etapa.

  8. 8

    Latent On-Policy Self-Distillation

    Método de auto-destilación on-policy en el espacio latente que reduce la dependencia de artefactos privilegiados diseñados a mano para el auto-mejoramiento continuo de agentes.

  9. 9

    Static analysis-guided agentic AI translation enables Rust as a full stack bioinformatics language

    Combina IA agéntica con análisis estático para traducir código legado (Perl, Fortran) a Rust en bioinformática.