Teléfono descompuesto
Di una sesión de tres horas y días después me regresó, dos niveles arriba, un resumen de lo que dije: corto, bien escrito y más seguro que yo. Nada era falso; faltaba todo lo que servía para decidir. La ciencia de este año le puso número a lo que se pierde: una de cada tres decisiones cambia cuando el reporte pasa por un resumen, y lo que se cae primero es el matiz, la duda y quién dijo qué. El teléfono descompuesto de siempre, con cada eslabón gratis, instantáneo y bien redactado.
Dato DuroSala de Juntas
Hace unas semanas di una sesión de esas largas, con sala llena y buenas preguntas. De las que uno sale contento porque la conversación se fue a donde tenía que irse, y no a donde decía la agenda. Alguien de la sala tomó notas, o las tomó su asistente, y armó un resumen para su jefe, que no había podido estar. El jefe lo condensó otra vez para su comité. Y unos días después, por un camino que no era el mío, me llegó de vuelta lo que yo había dicho.
Era corto, estaba bien escrito y sonaba más seguro que yo. Nada era falso: cada frase salía de algo que sí dije. Lo que faltaba era todo lo demás: el “depende” que abría cada respuesta, el ejemplo que la acotaba, la pregunta de la persona del fondo que le dio la vuelta a la conversación a media mañana. Lo que llegó al comité fue una recomendación limpia. Lo que hubo en la sala fue una discusión.
Todos jugamos teléfono descompuesto de niños: una frase al oído, diez en fila, y la carcajada al final. Lo que hacía gracioso el juego era que todos habíamos oído la frase original y podíamos comparar. En la versión de oficina nadie compara, porque nadie tiene la frase original a la mano, y el último de la fila no se ríe: decide.
Hernán Ojman me contó, en los comentarios de la pieza pasada, que cuando empezó la moda de los asistentes de notas había gente que dejó de ir a las juntas y mandaba a su asistente en su lugar. Él, en broma, asignaba tareas ridículas en la junta nada más para ver si le llegaban al ausente en sus siguientes pasos. Le llegaban, convertidas en pendientes formales: lo que no sobrevivía al resumen era la broma. De eso viene la pieza de esta semana, y va con una advertencia: la semana pasada conté una minuta que inventó un concierto. Esta semana nadie inventa nada. La cadena no agrega una sola palabra, y aun así lo que llega al final no es lo que pasó en la sala.
La frase al oído
lo que cuesta los resúmenes no fallaban por inventar: la máquina gana exactamente en cómo suena y pierde exactamente en lo que dice, y la brecha crece con el largo del documento →
Empiezo por el dato con dinero de por medio. Un equipo tomó 597 documentos reales de empresas del S&P 100 del ejercicio 2025 (300 secciones de discusión gerencial de reportes trimestrales y 297 transcripciones de llamadas de resultados) y midió algo distinto de lo usual: no cuánta información se pierde al resumir, sino cuántas veces esa pérdida cambia la decisión. Compararon la decisión de inversión que sugería el documento original contra la que sugería su resumen.
Con el resumen más común de todos, pedirle a un modelo que resuma, la decisión cambió en uno de cada tres reportes y en una de cada cuatro llamadas. Para dimensionarlo: cuando el mismo modelo relee el documento completo, sin comprimir, la decisión cambia en uno de cada nueve reportes y en una de cada once llamadas. Resumir triplica la probabilidad de terminar en una decisión distinta. Con compresores más agresivos sube a 53%, un volado. (Es un preprint, todavía sin revisión de pares, y los autores proponen su propio método al final, así que les conviene que el problema se vea grande; lo que salva el número es que lo comparan contra su propio piso.)
El mecanismo es lo que me interesa. Los resúmenes no fallaban por inventar: eran fluidos y verosímiles en los hechos. Lo que hacían era separar la evidencia de las salvedades que la interpretan. Los enunciados de contexto pasaban de ser 25% del documento original a 9% del resumen, y devolver a mano ese contexto revertía 37% de los cambios de decisión en los reportes. La salvedad cargaba la mitad del sentido. Y dos compresores distintos leyendo el mismo reporte discrepaban en uno de cada cuatro casos: lo que llega a tu bandeja es el resumen de ese proveedor, ese día, más que el resumen del documento.
Y lo incómodo es que se lee mejor. Un estudio de este año, aceptado en la sesión principal de EMNLP, una de las dos conferencias grandes del área, puso a cinco modelos de frontera de 2026 a resumir contra personas y midió por separado dos cosas que solemos confundir: qué tan bien se lee y cuánto contiene. Salieron al revés. Las personas ganaron la comparación global entre dos de cada tres y nueve de cada diez veces según el modelo; ganaron en informatividad y fidelidad frente a los cinco, y perdieron en coherencia frente a dos de ellos, GPT y Claude. La máquina gana exactamente en cómo suena y pierde exactamente en lo que dice. Y la brecha de contenido se ensancha con la longitud del documento: el que más se manda a resumir, porque nadie tiene tiempo de leerlo, es donde más se pierde.
Una de cada tres decisiones cambia al resumir: 597 documentos del S&P 100 (arXiv, preprint) · Summarization is Not Dead Yet: humanos contra cinco modelos de frontera (Liu y otros, EMNLP 2026)
A media fila
lo que se cae lo que se cae primero es la duda, el alcance y la gente: “posible neumonía” sale del resumen como “neumonía”, y el que habló a media sesión desaparece de la minuta →
Si lo que se pierde fuera parejo, se podría presupuestar. Pero el resumen tira una clase específica de material, y esta semana encontré tres mediciones, en tres mundos que no se hablan entre sí, que coinciden en cuál.
Arranco con la que más se parece a tu martes. Un banco de pruebas puso a 28 modelos a resumir 1,800 conversaciones de seis tipos y contó, hecho por hecho, cuáles sobrevivían. Hasta el mejor de los 28 modelos pierde casi uno de cada cinco hechos clave de una junta, mientras que lo que el resumen sí afirma casi siempre tiene respaldo. Se omite mucho más de lo que se inventa. Y de los seis escenarios, la junta resultó el peor en concisión y el segundo peor en completitud, solo arriba del guion de cine. De todo lo que se le puede pedir a un modelo que resuma, la junta es de lo que peor le sale, y es justo para lo que medio mundo lo está usando. (Los 27,631 hechos clave los extrajo un modelo, con arbitraje humano donde el propio modelo dudó. Preprint, sin revisión de pares.)
¿Y qué es lo que se cae? Lo que se cae primero es la duda: los “posible”, “preliminar” y “todavía no sabemos”. Una batería de 1,200 documentos clínicos, con más de 9,000 anotaciones de incertidumbre, encontró que tres modelos conservaron las señales de duda del original, por lo general, menos de la mitad de las veces, y que donde peor lo hacían era distinguiendo niveles vecinos, que es donde vive la decisión. La imagen, a partir del ejemplo de los autores: “posible neumonía” sale del resumen como “neumonía”. Nadie inventó nada; desapareció la única palabra que le decía al lector cuánto peso ponerle. Cámbiale neumonía por “posible retraso en la entrega” y ya estás en tu operación. (Preprint y dominio clínico: me sirve como imagen, no como porcentaje.)
También se cae el alcance, y aquí viene el dato que más me sorprendió. Un estudio con revisión de pares analizó 4,900 resúmenes de artículos científicos hechos por diez modelos: la mayoría de los modelos afirmaba algo más amplio de lo que el original permitía, y en tres de los más recientes eso pasó entre 26% y 73% de las veces, según el modelo; casi cinco veces más seguido que los resúmenes de expertos humanos sobre cien de esos textos. Y cuando le pidieron explícitamente al modelo evitar inexactitudes, la probabilidad de generalizar de más se duplicó. Esa coletilla la escribimos todos, de buena fe, al pie del encargo. Empuja en dirección contraria. (Tiene dieciséis meses, y los propios autores encontraron que los modelos más nuevos generalizaban peor.)
Y se cae gente. Cinco modelos resumieron cincuenta debates del Parlamento Europeo, 2,484 intervenciones de 708 oradores, y se midió orador por orador a quién representó bien el resumen. Los que hablaron a media sesión quedaron sistemáticamente excluidos: cuatro de los cinco modelos sesgaron por orden de intervención, dos hacia el que abre y dos hacia el que cierra, y en estos últimos muchos de los de en medio desaparecieron por completo. Y quien no habló en inglés salió perdiendo. El problema del idioma, del que hablo en el libro, aparece aquí en su versión más literal: el que habló en su idioma llegó peor al resumen. Si tu junta fue en español y el resumen se pidió en inglés para el corporativo, ya sabes quién llegó peor. Los autores separan además el sesgo de inclusión, omitir, del sesgo de alucinación, tergiversar, y encuentran que lo del idioma es sobre todo omisión. Omitir en lugar de tergiversar: la distinción es de ellos, no mía, y es la línea entre la minuta del concierto de la semana pasada y la cadena de esta semana.
Lo posible se vuelve definitivo: 1,200 documentos clínicos (Du, Lu y Qu, arXiv, preprint) · Generalización excesiva en 4,900 resúmenes científicos (Peters y Chin-Yee, Royal Society Open Science, 2025) · Quién desaparece del resumen: 708 oradores del Parlamento Europeo (Cunningham, Cross y Greene, taller AIDEM en ECML-PKDD 2025) · OmniCSEval: 1,800 conversaciones, 28 modelos, escenario de junta (Zhou y otros, arXiv, preprint)
El último de la fila
el que decide medido en personas: la fuente creíble de un rumor se pierde en 36.5% de las transmisiones y se inventa en 3.1%; “un amigo de un amigo” llega como “un amigo”, y así es más creíble →
Hasta aquí, todo es lo que le pasa al documento. Lo que más me detuvo esta semana es lo que le pasa al que lo lee. En un experimento presentado este año en CHI, la conferencia principal de interacción humano-computadora, 144 participantes leyeron hilos de discusión en tres proporciones reales de acuerdo: parejo, nueve a uno a favor y fuertemente en contra. Quienes leyeron solo el resumen narrativo del debate percibieron con frecuencia la discusión como equilibrada aunque estuviera fuertemente polarizada. La explicación de los autores no tiene adorno: como el resumen presentaba los dos argumentos, el lector concluyó que la sala estaba dividida.
Traducido a una junta: la minuta que dice “se discutieron ventajas y desventajas de la propuesta” es literalmente cierta y te deja creyendo que la sala estaba partida cuando nueve de cada diez estaban en contra. Y el consenso tibio es con lo que se decide seguir adelante. La salida obvia, pedirle al resumen el desglose de quién estaba de qué lado, también deforma, en sentido contrario: el porcentaje amplificó la conformidad y movió opiniones más que el resumen narrativo. Ninguna de las dos herramientas deja al lector donde estaba; una le esconde la mayoría y la otra se la impone. (Hilos simulados, no juntas reales; los propios autores advierten que el riesgo crece cuando el lector ya no puede ir al original.)
Nada de esto lo inventó la máquina. La psicología lleva noventa años haciendo el experimento del teléfono descompuesto con personas, y los resultados tienen la misma forma. En cadenas de diez personas que arrancan con artículos de prensa, los mensajes se vuelven más cortos, gradualmente inexactos y cada vez más distintos entre cadenas, mientras la percepción de riesgo se transmite con mucha más fidelidad, porque cada quien acomoda el recado a lo que ya creía. En otro montaje, cuatro estudios con 1,824 participantes en total, el que lo midió de frente, con 694 personas, encontró que la fuente creíble de un rumor se perdió en 36.5% de las transmisiones y se inventó en 3.1%. Doce a uno. Y con un mecanismo que vas a reconocer: “un amigo me contó que un amigo suyo” se retransmite como “un amigo me contó”. La cadena no solo tira quién lo dijo: acerca la fuente, y eso lo vuelve más creíble. El correo que llega diciendo “me confirmaron que el proveedor no cumple” empezó tres eslabones antes como “alguien de compras cree que podría haber un problema con una entrega”. Nadie mintió en ningún salto.
Cuando en 2023 replicaron con ChatGPT cinco de esos experimentos clásicos, el modelo se quedó con lo mismo que se queda la gente: lo que amenaza, lo social, lo negativo, lo que encaja con el estereotipo. El dato aburrido y bien portado es el que se cae. (El modelo tiene tres años; el sesgo que reprodujo es nuestro.) Lo que la máquina hizo con el teléfono descompuesto de siempre fue industrializarlo: cada eslabón es ahora instantáneo, gratis y sale bien escrito. Y lo que se cae en cada salto es exactamente el material con el que se juzga.
El resumen hace ver partido lo que estaba nueve a uno (Govers y otros, CHI 2026) · Cadenas de diez personas: el mensaje se borra, el juicio se amplifica (Moussaïd, Brighton y Gaissmaier, PNAS 2015; preprint abierto) · La fuente se pierde en 36.5% y se inventa en 3.1% (Altay, Claidière y Mercier, Evolutionary Human Sciences, 2020) · ChatGPT conserva lo mismo que conserva la gente (Acerbi y Stubbersfield, PNAS 2023)
Vuelve a empezar
el lunes
Dos trabajos independientes coinciden en dónde ocurre el daño. En las cadenas de resumen sobre resumen que se replicaron con ChatGPT en 2023, la mayor parte de la transformación ocurrió en el primer resumen; los pasos siguientes fueron comparativamente estables. Y en otro experimento con seis modelos y cadenas de cincuenta pasos, los autores predijeron cómo terminaría la cadena en la generación cincuenta (qué tan largo, qué tan áspero el texto) usando solo las primeras diez. El destino se fija temprano. El eslabón más importante es el primero, y es justo el que nadie revisa porque todavía se parece al original.
De ahí sale el tip de la semana para el próximo lunes, y cabe en una regla: el control va en el primer eslabón, no en tu escritorio. La semana pasada la regla fue que la minuta la firma quien la manda; esta semana es dónde se firma: en el único eslabón que todavía tiene la grabación a la mano. Quien hace el primer resumen, persona o asistente, lo coteja contra el original antes de mandarlo; nadie más en la cadena vuelve a comparar, porque nadie más puede.
Y a ti el resumen te llega con las tres cosas que hoy se caen primero: el “depende”, el “todavía no sabemos” y el nombre del que no estuvo de acuerdo. No hace falta que lo revises tú; esas tres son la seña de que alguien sí lo cotejó, porque son lo primero que desaparece cuando nadie lo hizo. Si llega sin ellas, pídelo de vuelta. Si la junta duró dos horas, pide además que se resuma en dos niveles, primero intervención por intervención, quién dijo qué, y después la síntesis de esas piezas; con los cinco modelos del Parlamento Europeo esa sola maniobra redujo de forma significativa el sesgo por orden de intervención, incluida la omisión de los que hablaron a media sesión.
Del resumen que me regresó dos niveles arriba, lo que me molestó fue lo bien que sonaba: más seguro que yo en la sala, más seguro que cualquier cosa que yo haya dicho ese día. La pregunta para el lunes va por ahí: de la última decisión que tomaste con un resumen en la mano, ¿sabes quién estuvo en contra en la sala? Y si no lo sabes, ¿cuántos eslabones hay entre esa sala y tu escritorio? En el juego de niños la carcajada venía de comparar. En la oficina nadie compara, y el último de la fila eres tú.
Esa fue la pieza de esta semana.
— JP
27 de 27 piezas
Leíste todas.
Pocas personas llegan hasta aquí, y me gustaría saber quién eres. Escríbeme con el asunto «Las 27» y te contesto yo.
Escríbeme— JP
La Pieza · newsletter semanal
Si esta pieza te sirvió, la próxima llega el martes a tu correo: un ensayo breve sobre IA y liderazgo, cinco minutos de lectura, sin tecnicismos y sin hype.
Un correo por semana · Sin spam · Baja cuando quieras
Clic. La conexión está hecha.
Suscripción confirmada. La próxima edición llega a tu correo el martes.