El Digestor

Una noticia, todas las fuentes.


METODOLOGÍA

Cómo funciona El Digestor

El Digestor lee en continuo 111 medios argentinos e internacionales de todo el espectro editorial, agrupa las coberturas de un mismo hecho y las convierte en una sola nota sintetizada, con todas las versiones a la vista. Esta página documenta el método completo — fórmulas, umbrales, compuertas de calidad y datos de operación reales — y se regenera todos los días. Quien quiera auditar cómo llegamos a cada número, acá tiene la respuesta.

1. Principios

2. Qué no somos

3. El pipeline, paso a paso

  1. Ingesta (cada 30 min): leemos los RSS de las 111 fuentes activas. Se filtra ruido (horóscopo, lotería, clima), se descartan fechas de publicación inverosímiles — comunes en feeds agregados; en ese caso vale la hora real de ingesta — y las inserciones son idempotentes: el mismo artículo no entra dos veces. Rige además un tope de paridad: ninguna fuente puede aportar más de 20 artículos por ciclo, para que un medio de altísimo volumen no ahogue al resto del corpus.
  2. Vectorización (cada 5 min): cada artículo nuevo se convierte en un vector semántico con un modelo multilingüe auto-hosteado.
  3. Agrupamiento (cada 5 min): cada artículo busca el evento más cercano por distancia coseno sobre el centroide (umbral estricto: distancia ≤0,18, similitud ≥0,82), en una ventana de 48 horas. Un tope de miembros por evento (30) evita los "blobs" temáticos que mezclan hechos distintos.
  4. Adjudicación de identidad (Gate B): antes de que un artículo entre a un evento existente, un modelo de lenguaje compara su titular con los ya asignados y decide si es exactamente el mismo hecho — mismas personas, misma acción, mismo lugar y momento — o solo el mismo tema. Ante rechazo, duda o error, la decisión por defecto es conservadora: el artículo nunca contamina un evento ajeno, siembra uno nuevo.
  5. Detección de ecos: dentro de cada evento se comparan los textos entre sí (similitud de trigramas). Similitud ≥0,85 = reproducción del mismo despacho. El artículo se marca como eco y se muestra debajo del original que repite — no se descuenta del conteo ni se esconde. Exhibir la repetición es el punto: si seis medios publicaron el mismo cable, eso es un dato sobre el ecosistema, no ruido para filtrar.
  6. Síntesis: los eventos con ≥2 voces distintas pasan a síntesis. El resultado es una nota nueva con atribución por afirmación: qué sostiene cada versión, y según qué medio.
  7. Compuertas de calidad: toda salida del modelo pasa por controles deterministas antes de publicarse (sección 10). Lo que no los pasa, no se publica.
  8. Imagen, con derechos: la imagen de cada nota sale de la imagen destacada del artículo que citamos (con crédito visible al medio), de repositorios con licencia libre, o de una tarjeta tipográfica propia. Nunca de un generador de imágenes (sección 11).
  9. Publicación: el sitio es HTML estático y es el mismo para todos — sin personalización, sin burbuja algorítmica. La historia principal se elige por recencia + diversidad (sección 8).

4. Las métricas centrales: medios, grupos y polos

No publicamos un índice compuesto. Publicamos tres números crudos por nota, cada uno recalculable a mano desde la lista de fuentes que acompaña la nota:

Ejemplo: un hecho cubierto por Clarín, TN y otros tres medios de dueños distintos son 5 medios · 4 grupos editoriales, porque Clarín y TN pertenecen ambos a Grupo Clarín. Los cinco artículos siguen listados, con su link y su hora.

Cuando todos los medios que cubrieron un hecho pertenecen a un mismo grupo, la nota lo marca: "un solo grupo editorial". No significa que el hecho sea falso ni manipulado. Significa que merece leerse sabiendo que una sola empresa decidió que valía la pena contarlo.

Qué cambió y por qué. Hasta agosto de 2026 esta página describía otra métrica: un cociente que descontaba del conteo los medios de un mismo grupo y las reproducciones textuales. La dimos de baja. Un cociente que baja el número sin mostrar de dónde sale se parece demasiado a esconder cobertura, que es lo contrario de lo que este proyecto quiere hacer. La concentración ahora se muestra al lado del conteo, no adentro de él.

5. Puntos ciegos

Un punto ciego es un hecho que solo una parte del espectro decidió cubrir. Una noticia no necesita ser falsa para desinformar: alcanza con que nunca te llegue.

Cada nota muestra el desglose de sus fuentes por polo editorial (izquierda / centro / derecha). La banda de tendencias de la portada marca Punto Ciego cuando la cobertura reciente de un tema proviene de un solo polo. No decimos qué pensar de esa asimetría: la mostramos.

6. Cómo clasificamos las fuentes

Cada medio del corpus tiene dos lecturas complementarias:

La clasificación es manual y se asigna al incorporar cada fuente. Es un juicio editorial — el único que emitimos — y por eso es pública, versionada y discutible: si creés que un medio está mal clasificado, planteálo con tu argumento por el formulario del pie (sección 14). Se revisa a mano.

Mapa actual del corpus (105 de 111 medios activos clasificados en ambos ejes)

izq der occidentalista multipolar ADN Río Negro (Viedma)AgritotalAgroempresarioAl Jazeera EnglishÁmbitoAnálisis Digital (Paraná, Entre Ríos)ANRedAP en españolBAE NegociosBBC MundoBichos de CampoBrasil de FatoBrecha (Uruguay)Canal AbiertoCenitalClarínClarín RuralCorrientes HoyCrisisCrónica (Comodoro)CTXT (España)Diario ChacoDiario de Cuyo (San Juan)Diario Época (Corrientes)Diario FormosaDiario Jornada (Trelew, Chubut)Diario La Mañana (Formosa)Diario Norte (Chaco)Diario Pregón (Jujuy)Diario Uno (Mendoza)DW LatinoaméricaEcoPortal.netEl Ancasti (Catamarca)El Cohete a la LunaEl CronistaEl DestapeEl Día (La Plata)El Diario (Paraná, Entre Ríos)El Diario de la República (San Luis)El Diario del Fin del Mundo (Tierra del Fuego)El DiplóEl Esquiú (Catamarca)El Grito del SurEl Independiente (La Rioja)El Liberal (Santiago del Estero)El Litoral (Santa Fe)El Salto (España)El Sureño (Río Grande, Tierra del Fuego)El Territorio (Misiones)El Tribuno (Salta)El Tribuno de JujuyEl TucumanoForbes ArgentinaFortunaFrance 24 españolGreenpeace ArgentinaInfobaeInfocampoInformate SaltaIProfesionalLa Arena (La Pampa)La Capital (Rosario)La Diaria (Uruguay)La Gaceta (Tucumán)La Izquierda DiarioLa Jornada (México)La Mañana de NeuquénLa NaciónLa Nación CampoLa Nueva (Bahía Blanca)La Opinión Austral (Río Gallegos, Santa Cruz)La Política OnlineLa Reforma (General Pico, La Pampa)La Vaca / MULa Voz del CampoLa Voz del InteriorLatfem (feminista + izquierda)Letra PLos Andes (Mendoza)Mejor Informado (Neuquén)Mendoza PostMercadoMisiones OnlineNueva Rioja (La Rioja)Nueva SociedadNuevo Diario (Santiago del Estero)Página/12PerfilPregón AgropecuarioPúblico (España)Punto a PuntoRedAcciónResumen LatinoamericanoReuters ArgentinaRevista AnfibiaRío NegroSan Luis 24TeleSURTiempo ArgentinoTiempo de San JuanTiempo Sur (Patagonia)Tierra VivaTinta LimónTNTramas

Cada punto = un medio. El cursor muestra el nombre.

6 bis. Propiedad de los medios

A cada medio del corpus le asignamos su grupo propietario. No es un juicio editorial nuestro, como sí lo es la orientación: es un dato societario, y lo publicamos con su fuente y su fecha.

La base principal es el Media Ownership Monitor Argentina, el relevamiento de Reporteros Sin Fronteras junto a Tiempo Argentino, que investigó la propiedad de 52 medios argentinos y publica fichas por grupo y por propietario. Donde MOM no llega, o donde hubo un cambio de manos posterior a su relevamiento, citamos la operación puntual con su fuente y su fecha.

La propiedad cambia de manos y los relevamientos envejecen. Cada asignación lleva la fecha del dato que la respalda, y los medios sin dato verificado quedan sin grupo asignado antes que con uno inventado: en el conteo de grupos, cada medio sin dato cuenta como grupo propio. Si tenés una corrección con fuente, mandala por el formulario del pie.

7. El corpus, por orientación editorial

Estado actual del corpus Digestor AR (reference deployment). "En clasificación" agrupa medios incorporados recientemente — en su mayoría diarios provinciales — cuya revisión editorial todavía no cerró: sus artículos cuentan como voces en la síntesis, sin etiqueta de polo.

OrientaciónFuentes
IzquierdaANRed, Brasil de Fato, Brecha (Uruguay), Canal Abierto, Crisis, CTXT (España), EcoPortal.net, El Cohete a la Luna, El Dipló, El Grito del Sur, El Salto (España), Greenpeace Argentina, La Diaria (Uruguay), La Izquierda Diario, La Jornada (México), La Vaca / MU, Latfem (feminista + izquierda), Público (España), Resumen Latinoamericano, TeleSUR, Tierra Viva, Tinta Limón, Tramas
CentroizquierdaAl Jazeera English, Bichos de Campo, Cenital, Diario Formosa, El Destape, El Diario de la República (San Luis), El Tribuno de Jujuy, La Opinión Austral (Río Gallegos, Santa Cruz), Letra P, Nueva Sociedad, Página/12, REALPOLITIK, RedAcción, Revista Anfibia, Tiempo Argentino, Tiempo Sur (Patagonia)
CentroAP en español, BBC Mundo, Chequeado, Crónica (Comodoro), Diario Norte (Chaco), Diario Uno (Mendoza), DW Latinoamérica, El Día (La Plata), El Litoral (Santa Fe), France 24 español, La Capital (Rosario), La Mañana de Neuquén, La Política Online, Reuters Argentina, Reverso, Río Negro, TodoAgro
CentroderechaAgritotal, Agroempresario, BAE Negocios, Diario de Cuyo (San Juan), El Liberal (Santiago del Estero), El Tribuno (Salta), Fortuna, Infocampo, La Gaceta (Tucumán), La Nueva (Bahía Blanca), La Voz del Campo, La Voz del Interior, Los Andes (Mendoza), Mendoza Post, Mercado, Nueva Rioja (La Rioja), Pregón Agropecuario, Punto a Punto
DerechaClarín, Clarín Rural, Forbes Argentina, Infobae, IProfesional, La Nación, La Nación Campo, Perfil, TN
Prensa económicaAgrofy News, Ámbito, El Cronista
EstatalTélam
En clasificaciónADN Río Negro (Viedma), Análisis Digital (Paraná, Entre Ríos), Corrientes Hoy, Diario Chaco, Diario Época (Corrientes), Diario Jornada (Trelew, Chubut), Diario La Mañana (Formosa), Diario Pregón (Jujuy), El Ancasti (Catamarca), El Diario (Paraná, Entre Ríos), El Diario del Fin del Mundo (Tierra del Fuego), El Esquiú (Catamarca), El Independiente (La Rioja), El Sureño (Río Grande, Tierra del Fuego), El Territorio (Misiones), El Tucumano, Informate Salta, La Arena (La Pampa), La Reforma (General Pico, La Pampa), Mejor Informado (Neuquén), Misiones Online, Nuevo Diario (Santiago del Estero), San Luis 24, Tiempo de San Juan

8. Cómo se arma cada nota y cómo se elige la portada

Cada nota muestra, además de la síntesis, la lista completa de artículos originales que la componen: favicon, medio, chip de orientación editorial y hora argentina, ordenados del más reciente al más antiguo, cada uno con link directo a la fuente.

La portada es la misma para todos los lectores. Para elegir la historia principal, los eventos se agrupan por niveles de antigüedad (menos de 24 h, menos de 48 h, más viejos) y dentro de cada nivel gana el que tenga más polos editoriales distintos cubriéndolo; la fecha exacta recién desempata al final. Eso evita dos fallas típicas: que una noticia vieja quede "pegada" arriba por la cobertura que tuvo en su momento, y que una nota fresca de un solo medio le gane a una con cobertura cruzada real.

Los temas visuales de cada producto cambian tipografía y color. Nunca contenido ni orden editorial.

9. Dónde interviene la IA — y dónde no

Modelos de lenguaje intervienen en exactamente dos puntos del pipeline, siempre detrás de compuertas:

Cada tarea corre sobre una cadena redundante de modelos de varios proveedores independientes, con failover automático: si un proveedor se degrada, el siguiente toma la carga. Síntesis y adjudicación usan cadenas separadas para no competir por capacidad, y ningún proveedor concentra el volumen. Cada llamada queda registrada — modelo, latencia, resultado — y ese registro alimenta el control de la sección 10.

Dónde no hay IA: en las imágenes (nunca generativas — sección 11), en la clasificación de fuentes (manual — sección 6) y en la presentación: ninguna interfaz conversacional, ningún resumen sin fuentes. Cada afirmación remite a artículos reales que podés abrir.

Prompts versionados

Cada prompt de síntesis y de adjudicación se guarda con número de versión; las anteriores quedan como registro de auditoría. La versión activa es la que produce las notas de hoy.

TareaVersión activaHistorial
adjudicate_event_identityv1
article_rewrite_esv1
blindspot_digestv1
daily_brief_synthesis_esv1
extract_articlev1
synthesize_eventv10v1, v2, v5, v6, v7, v8, v9

10. Control de calidad, en vivo

Toda salida de modelo pasa por compuertas deterministas antes de publicarse: esquema estructural válido, consistencia de fuentes — una síntesis que menciona un medio o una URL que no está entre las fuentes reales del evento se descarta entera — y el propio modelo puede objetar un agrupamiento que considera inválido. Lo retenido nunca llega al lector.

Síntesis generadas (24 h)
306
Retenidas por la compuerta
65 (21%)

Retenidas, por motivo

MotivoCasos (24 h)
Salida no parseable cco_not_json30
Citó un medio o URL ajenos al evento factual_inconsistency21
No cumplió el esquema estructural cco_schema_violation12
likely_topic_blob likely_topic_blob2

El número de retenidas se lee como lo que es: el precio de publicar únicamente lo que pasa el control. Preferimos retener de más antes que publicar una síntesis que cite mal a un medio.

11. Uso del contenido de los medios

De cada artículo reproducimos, como máximo, un extracto breve (≤300 caracteres), siempre con atribución y link directo. Nunca la nota completa: quien quiere leer el original va al medio, y cada nota se lo facilita a propósito. Este uso se apoya en el derecho de cita — en Argentina, artículo 10 de la ley 11.723 — y en sus equivalentes regionales: extensión mínima, atribución, link a la fuente y una obra nueva que no sustituye a la original.

Imágenes. La imagen de cada nota proviene, en este orden, de: la imagen destacada del artículo que citamos, con crédito visible al medio; material con licencia libre (Wikimedia Commons y afines), atribuido; o una tarjeta tipográfica propia cuando ninguna de las anteriores tiene derechos claros. Nunca generamos imágenes con IA.

Si un medio prefiere que su contenido o su imagen destacada no aparezca en El Digestor, lo retiramos: basta pedirlo por el formulario del pie de esta página.

12. Datos de operación

Eventos detectados desde 2026-06-17
119.703
Sintetizados (≥2 voces distintas)
11.127
Voces distintas por síntesis (promedio)
2,41
Artículos marcados como eco (reproducción textual de otro medio)
2.779
Fuentes activas
111

Nota metodológica: no publicamos un "promedio de diversidad" sobre los eventos ya sintetizados — después de la compuerta de ≥2 voces, ese promedio da ~1,0 por construcción y no informa nada. El dato que sí informa es cuántos eventos quedaron afuera por ser una sola voz repetida en varios medios.

13. Privacidad: lo que no hacemos

14. Corpus abierto y correcciones

El corpus no es una lista cerrada ni curada puertas adentro. Cualquiera puede proponer un medio desde el formulario de abajo — también está en la portada y en cada perfil de medio. Ninguna propuesta se activa sola: pasa por una validación técnica del feed y una revisión manual antes de sumarse; proponer no publica nada por sí solo. El criterio de entrada es simple: medios reales, con feed operativo, que ensanchen el espectro cubierto — sin filtro ideológico en la puerta de entrada.

El mismo formulario es el canal de correcciones y disputas: si encontraste un error en una nota, o creés que un medio está mal clasificado, dejá el link y tu argumento en el comentario. Se revisa a mano.

15. Quién está detrás

El Digestor es un proyecto independiente, operado de forma seudónima. Es una decisión deliberada, no un descuido: acá no hay firmas que pesen más que el método. El producto se evalúa por lo que se puede auditar — las fórmulas, los umbrales, los datos de operación y el comportamiento del pipeline, publicados en esta página. Lo que un nombre propio agregaría en confianza, lo tiene que ganar la metodología.

¿Falta un medio?

El corpus es abierto por diseño: cualquiera puede proponer una fuente para que la sumemos.