AI agents and LLM tooling
8 papers seleccionados por el agente esta mañana
- 1
Intern-S2-Preview: Scientific Agentic Foundation Model
Serie de modelos fundacionales agénticos multimodales que razonan sobre evidencia científica, usan herramientas y sostienen tareas científicas de largo horizonte.
- 2
Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI R&D
Evalúa siete modelos frontera en 36 tareas de largo horizonte con métricas de comportamiento intra-ejecución más allá del puntaje final.
- 3
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
Un optimizador de meta-harness guía a un agente de código para mejorar recursivamente su andamiaje y acumular experiencia reutilizable.
- 4
Vero: Can AI Agents Build Formally Verified Software Repositories?
Benchmark que mide si los agentes pueden generar implementación y prueba verificable coherentes a través de repos multi-módulo reales.
- 5
QuoteBench: How Matched Scores Can Hide Command-Path Failures
Aísla fallos de agentes de código introducidos por el transporte de ejecución (serialización/reparseo de Bash) frente a errores de generación.
- 6
RippleMem: From Isolated Retrieval to Associative Recollection for Long-Term Agent Memory
Memoria de largo plazo que pasa de la recuperación aislada a la recolección asociativa para recuperar el conjunto correcto de evidencia.
- 7
When Your Agent Opens the Chat App: Agent-Controlled Search over Raw Chat Logs
ReFind muestra que un bucle iterativo de búsqueda léxica sobre logs crudos rivaliza con la memoria estructurada costosa.
- 8
MARC v1: An Open-Source Multi-Agent Framework for Clinical AI Reasoning
Orquestación multi-agente determinista con paso explícito de contexto y atribución de fallos por etapa para razonamiento clínico.