Cómo funciona
Un agente que no cita nada de memoria
Los modelos de lenguaje resumen muy bien, pero inventan cifras con total confianza: stars de un repo, la fecha de un paper, si existe una implementación. Paper Scout da vuelta ese punto débil: es un agente construido sobre la Claude API cuya regla central es que solo puede citar lo que devuelven sus herramientas — las APIs de arXiv y GitHub, consultadas en el momento.
El pipeline
Busca
Consulta la API de arXiv por los temas del día (o de tu proyecto), con varias búsquedas en paralelo.
Descubre
Busca en GitHub implementaciones de cada paper y herramientas útiles, por nombre de método o keywords.
Verifica
Antes de citar un repo, lo consulta por API: existencia, descripción, actividad y stars exactas.
Publica
El digest se commitea al repo y el sitio se regenera solo; el scout te responde en vivo, con streaming.
La evidencia
¿Cómo sabemos que funciona? Con una evaluación programática: una suite de tareas cuyos criterios se chequean por código — los links resuelven, los repos existen, las stars coinciden con la API — y dos ablations que muestran qué pasa cuando se quita el grounding.
| Configuración | Checks | Repos citados → reales | Stars exactas |
|---|---|---|---|
| Agente completo | 26/26 (100%) | 3 → 3 (100%) | 3/3 (100%) |
| Sin herramientas de GitHub | 26/26 (100%) | 0 — se abstiene | — |
| Bot “naive” (sin grounding) | 16/26 (62%) | 33 → 3 (9%) | 0/33 (0%) |
El experimento clave:a un bot con un prompt descuidado — “incluí el repo más probable y estimá sus stars”, sin herramientas — se le pidió lo mismo. Inventó 30 de 33 repositorios con nombres perfectamente creíbles y stars concretas, todas falsas. El mismo modelo, con herramientas y la regla de grounding, comete cero errores factuales. Esa diferencia es este producto.
Hasta hoy
- 30
- digests
- 256
- papers curados
- 13
- repos verificados
Contado automáticamente de los digests publicados desde 2026-07-23. El digest corre solo, todas las mañanas, con GitHub Actions.
Bajo el capó
Claude (Opus) con tool use sobre la Claude API; las herramientas son las APIs públicas de arXiv y GitHub. El sitio es Next.js generado estáticamente desde los digests versionados en git — el repo es la base de datos — y el scout corre el mismo agente on-demand, con streaming del progreso. La suite de evaluación corre los mismos checks sobre el digest diario y sobre las respuestas del scout.