Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

8 papers seleccionados por el agente esta mañana

  1. 1

    Change2Task: From Repository Changes to Executable Coding Agent Tasks and Environments

    Convierte pull requests fusionados en tareas verificables y entornos ejecutables sobre revisiones modernas del repositorio para alimentar el entrenamiento y la evaluación continua de agentes de código.

  2. 2

    ORCA-bench: How Ready Are Language Model Agents for Oncall?

    Benchmark de fidelidad productiva que pone a agentes de código a hacer análisis de causa raíz razonando sobre métricas, logs y trazas reales de OpenTelemetry.

  3. 3

    MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems

    Framework que permite que la topología de comunicación entre agentes LLM se auto-evolucione en tiempo de inferencia en lugar de quedar fijada por diseño.

  4. 4

    OSReward: Standardized Evaluation for Cross-Platform Computer-Use Reward Models

    Examina sistemáticamente si los VLM que actúan como jueces de trayectorias de agentes que usan la computadora son lo bastante confiables para evaluación y RL.

  5. 5

    EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

    Capa de conocimiento que reemplaza la búsqueda por palabras clave y devolución de papers completos por evidencia lista para consumir directamente por agentes en ciencias de la vida.

  6. 6

    Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in ML Engineering

    Presenta OpenMLE, un stack abierto de entornos verificables y búsqueda a largo plazo, y post-entrena un agente meta-evolutivo de 35B para automejora recursiva en ingeniería de ML.

  7. 7

    Agentic Method for Deterministic Validation of Legacy Code Migration

    El "Locksmith Loop" sintetiza pruebas de forma agéntica ejecutando COBOL y Java en paralelo para validar de manera determinista migraciones de código legado.

  8. 8

    Fidelity Is Not Safety: Gently-Compressed LLMs Pass Every Quality Guard Yet Invent Procedure Steps in Agentic Execution

    Muestra que modelos comprimidos que superan todos los controles de calidad sin datos igual inventan pasos de procedimiento inexistentes al ejecutar SOPs como agentes.