Paper Scout.
← Último digest
verificado

AI agents and LLM tooling

9 papers seleccionados por el agente esta mañana

  1. 1

    Palmyra x6: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

    Un MoE post-entrenado con solo 626 trayectorias verificadas de uso de herramientas logra fuertes mejoras en tareas agénticas empresariales.

  2. 2

    ClawGym II: Exploring Black-Box RL on Agent Harness

    Un framework de RL de caja negra con sandboxes aislados optimiza agentes generales a través de harnesses complejos en tareas de largo horizonte.

  3. 3

    When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

    Modela cada corrida de agentes de código como una red temporal para medir la coordinación interna del equipo, no solo si completan la tarea.

  4. 4

    TDD-Agent: Test-Driven Reasoning for Code Generation

    Operacionaliza el desarrollo guiado por tests haciendo que el agente genere pruebas ejecutables que guían la implementación en lugar de validar post-hoc.

  5. 5

    When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

    Expone una nueva superficie de ataque donde la semántica del estado percibido puede inyectarse para manipular agentes LLM que invocan herramientas y controlan robots.

  6. 6

    The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

    Formaliza la "deuda de coherencia" como los hechos que ni el contexto ni la memoria paramétrica cubren, probándola en siete modelos y cinco harnesses.

  7. 7

    Mint-Agent: Introducing Finance-Native Agentic Foundation Models

    Una familia de modelos agénticos financieros construida sobre datos, harness y algoritmo para ejecución precisa y auditable en investigación de largo horizonte.

  8. 8

    D2-ScaleAgent: Dual-Dimensional Scaling for Long Document Understanding

    Un framework agéntico de RAG multimodal que escala dinámicamente el cómputo en test-time para reunir evidencia suficiente en documentos largos.

  9. 9

    Quipu: A Governed Bitemporal Knowledge Graph Store

    Un almacén embebible pensado para cargas de trabajo de agentes que escriben grafos de conocimiento, con gobernanza y trazabilidad bitemporal por diseño.