Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems

    Permite que la topología de comunicación entre agentes se auto-evolucione en tiempo de inferencia en lugar de fijarse de antemano.

  2. 2

    MemHarness: Memory Is Reconstructed, Not Replayed

    Reelabora las experiencias recuperadas para adaptarlas al estado actual del agente, evitando el "replay" verbatim que causa transferencia negativa.

  3. 3

    ORCA-bench: How Ready Are Language Model Agents for Oncall?

    Un benchmark de fidelidad de producción que pone a agentes de código a hacer análisis de causa raíz sobre métricas, logs y trazas reales.

  4. 4

    Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

    Convierte pull requests fusionados en tareas ejecutables y verificables para entrenar y evaluar agentes de programación.

  5. 5

    OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Cuestiona y estandariza la fiabilidad de los VLMs usados como jueces de trayectorias de agentes que operan computadoras.

  6. 6

    How Benchmarks Mis-Score Computer-Use Agents

    Audita 150 trayectorias fallidas y muestra cómo oráculos frágiles inflan o distorsionan los puntajes de los agentes de uso de computadora.

  7. 7

    EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

    Propone una capa de conocimiento que devuelve evidencia atómica en vez de papers completos, pensada para agentes en lugar de humanos.

  8. 8

    HALO: Heterogeneous Admission through Localized Obligations for Safe Agentic Execution

    Un protocolo en tiempo de ejecución que preserva selectivamente los componentes válidos de una respuesta agéntica y revalida cada acción antes de ejecutarla.

  9. 9

    Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

    Post-entrena un agente meta-evolutivo de 35B sobre operadores atómicos de evolución de programas para automejorar la ingeniería de ML.