Paper Scout.

Cómo funciona

Un agente que no cita nada de memoria

Los modelos de lenguaje resumen muy bien, pero inventan cifras con total confianza: stars de un repo, la fecha de un paper, si existe una implementación. Paper Scout da vuelta ese punto débil: es un agente construido sobre la Claude API cuya regla central es que solo puede citar lo que devuelven sus herramientas — las APIs de arXiv y GitHub, consultadas en el momento.

El pipeline

1

Busca

Consulta la API de arXiv por los temas del día (o de tu proyecto), con varias búsquedas en paralelo.

2

Descubre

Busca en GitHub implementaciones de cada paper y herramientas útiles, por nombre de método o keywords.

3

Verifica

Antes de citar un repo, lo consulta por API: existencia, descripción, actividad y stars exactas.

4

Publica

El digest se commitea al repo y el sitio se regenera solo; el scout te responde en vivo, con streaming.

La evidencia

¿Cómo sabemos que funciona? Con una evaluación programática: una suite de tareas cuyos criterios se chequean por código — los links resuelven, los repos existen, las stars coinciden con la API — y dos ablations que muestran qué pasa cuando se quita el grounding.

ConfiguraciónChecksRepos citados → realesStars exactas
Agente completo26/26 (100%)3 → 3 (100%)3/3 (100%)
Sin herramientas de GitHub26/26 (100%)0 — se abstiene
Bot “naive” (sin grounding)16/26 (62%)33 → 3 (9%)0/33 (0%)

El experimento clave:a un bot con un prompt descuidado — “incluí el repo más probable y estimá sus stars”, sin herramientas — se le pidió lo mismo. Inventó 30 de 33 repositorios con nombres perfectamente creíbles y stars concretas, todas falsas. El mismo modelo, con herramientas y la regla de grounding, comete cero errores factuales. Esa diferencia es este producto.

Hasta hoy

30
digests
256
papers curados
13
repos verificados

Contado automáticamente de los digests publicados desde 2026-07-23. El digest corre solo, todas las mañanas, con GitHub Actions.

Bajo el capó

Claude (Opus) con tool use sobre la Claude API; las herramientas son las APIs públicas de arXiv y GitHub. El sitio es Next.js generado estáticamente desde los digests versionados en git — el repo es la base de datos — y el scout corre el mismo agente on-demand, con streaming del progreso. La suite de evaluación corre los mismos checks sobre el digest diario y sobre las respuestas del scout.