Resumen de la publicación
El 17 de septiembre se desprecintaron los escritos del juicio del New York Times contra OpenAI y Microsoft. Adentro aparece un memo interno de enero de 2023 de Brent Hecht, director de Applied Science de Microsoft, que dice que el público va a ver el scraping masivo como «un robo asombroso de proporciones sin precedentes», el «robo de trabajo más grande de la historia de la humanidad». Una presentación suya de enero de 2024 describe el mecanismo completo y lo bautiza «doom loop».
Lo que me interesa no es el escándalo de la frase. Es que el diagnóstico más preciso del problema lo escribió alguien de adentro, años antes, y que el círculo que describe ya te alcanza si mantenés un blog técnico, la documentación de un proyecto chico o cualquier cosa que otros leen.
Frases fuertes sobre la IA y los derechos de autor escuché muchas. Casi todas venían de afuera: de editores enojados, de gremios de guionistas, de abogados en conferencia de prensa.
La de esta semana salió de adentro, de un directivo de Microsoft, escrita para consumo interno y sin ninguna intención de que la leyéramos.
Cuando un escrito judicial se desprecinta, lo primero que circula es la cita más ruidosa. Yo me quedé con otra cosa: el cargo del que la escribió, la fecha, y que el texto no es una opinión moral sino una descripción de ingeniería.
Quién lo dijo, y cuándo
El 17 de septiembre, el juez Sidney Stein (Distrito Sur de Nueva York, causa 1:23-cv-11195) permitió publicar sin tachaduras un escrito que el New York Times y otros editores habían presentado pidiendo que falle a su favor antes del juicio.
En ese escrito aparece Brent Hecht, director de Applied Science de Microsoft. No es un empleado cualquiera que se calentó en un chat.
Hecht es investigador de IA centrada en las personas y profesor afiliado en Northwestern, y una de sus líneas de trabajo de toda la vida es exactamente data labor: el trabajo humano que queda incorporado en los datos con los que se entrenan los modelos.
O sea: Microsoft contrató a la persona que piensa este problema, esa persona escribió lo que pensaba, y quedó en el expediente.
Las fechas son la otra mitad del asunto, y conviene ordenarlas porque las citas ya están circulando sueltas.
- Enero de 2023. Un memo interno donde Hecht avisa que «millones de personas en todo el mundo van a considerar pronto que los modelos grandes “aspiren” todo su trabajo es un robo asombroso de proporciones sin precedentes», y quizás «el robo de trabajo más grande de la historia de la humanidad». En el mismo texto dice que ese plan haría «una burla completa a la idea de fair use».
- Enero de 2024. Una presentación interna suya donde ya no hay indignación, hay diagrama de bloques: describe el «doom loop» (el círculo vicioso) que iba a «dañar el rendimiento de nuestros modelos y a toda la web al mismo tiempo».
Enero de 2023 es semanas antes de que Microsoft anunciara el nuevo Bing con chat. Es decir, antes de que el producto existiera en la calle.
Y enero de 2024 es el mes siguiente a que el New York Times presentara la demanda. La advertencia no llegó tarde ni de casualidad: llegó antes, y después se repitió con el juicio ya encima.
El doom loop, sin dramatizar el título
La frase del robo es la que viaja, pero la que a mí me parece importante es esta otra, de la presentación de 2024:
«Es muy poco habitual que un producto final amenace los cimientos económicos de sus proveedores esenciales, pero esa es la situación que creamos para nuestro negocio de LLM respecto de su “cadena de suministro de contenido”».
Eso no es una queja ética, es una observación sobre el diseño del sistema. Hecht lo resume en otra parte diciendo que los modelos grandes son un producto que destruye su propia cadena de suministro.
El circuito tiene cuatro pasos y ninguno es hipotético:
- El modelo se entrena con lo que otros escribieron.
- El producto responde la pregunta en pantalla, así que el usuario ya no hace clic.
- Sin clics no hay ingresos, y sin ingresos se produce menos y peor contenido.
- La próxima generación del modelo entrena con ese material más pobre.
El paso dos dejó de ser teórico dentro de la propia Microsoft. Según los datos internos citados en el escrito, el motor de respuestas de Copilot llegó a derivar hasta un 93% menos de tráfico al dominio del New York Times que una búsqueda tradicional de Bing.
No es «la IA le saca lectores al diario». Es dos órdenes de magnitud menos de clics medidos por el mismo equipo que construyó la cosa.
Del otro lado del expediente
En OpenAI la conversación interna fue parecida, con otro vocabulario.
Nick Turley, que dirige ChatGPT, escribió que los editores enfrentaban una «amenaza existencial» por productos que ya eran «en buena medida sustitutivos» y que «van a ser cada vez más sustitutivos a medida que mejoren».
Greg Brockman, presidente de la empresa, describía a los modelos como «excelentes en noticias». Y cuando un investigador mencionó un truco para saltar el muro de pago del Times, contestó «ah, buenísimo».
Satya Nadella, ya bajo juramento, aceptó que una conversación con el chatbot sustituye ir a la fuente: te da la información ahí mismo en la plataforma de IA en vez de mandarte al sitio original.
La respuesta pública de Microsoft fue la esperable, y honestamente es la única que se podía dar: los comentarios de Hecht «reflejan la perspectiva individual de un empleado, no son un análisis legal y no representan la posición de la compañía».
Es verdad que un memo no es una admisión jurídica, y no me voy a poner a hacer de abogado. Pero como argumento técnico tiene un problema: el memo no dice «esto es ilegal». Dice cómo funciona el sistema. Y eso no cambia según quién firme.
Vos ya estás adentro de ese círculo
Acá es donde esto deja de ser una pelea de gigantes en Manhattan.
Cuando Hecht habla de «cadena de suministro de contenido» no se refiere solamente a los diarios grandes. Se refiere a lo que hay escrito en la web, y buena parte de lo que un modelo sabe de nuestro oficio no lo escribió ningún medio.
Lo escribimos nosotros, gratis y sin contrato:
- El blog técnico donde alguien contó cómo resolvió un error raro de Kubernetes a las tres de la mañana.
- La documentación de un proyecto open source chico, mantenida por dos personas los fines de semana.
- La respuesta larga y bien argumentada en un foro, en un issue de GitHub o en un hilo de la comunidad.
- Los posts de las user groups, que existen justamente para que otro no tenga que repetir el mismo error.
Ese material está del lado de adelante del círculo, en el eslabón de los «proveedores esenciales», y es el más frágil de todos. Un diario tiene abogados y puede litigar. El que mantiene un paquete con 400 estrellas no tiene nada.
Tampoco tiene la motivación económica del diario, y ese es el punto que me preocupa más. Nadie escribe la documentación de su librería por el tráfico. La escribe porque quiere que la usen, porque le gusta, porque alguien se lo pidió en un issue.
Esa motivación es real pero es finísima, y lo que la sostiene es bastante básico: que se note que sirvió. Cuando desaparecen las visitas, las preguntas y los «gracias, me salvaste», lo que se apaga no es un modelo de negocio. Es las ganas.
No estoy anunciando el fin de nada. Estoy diciendo que el eslabón que primero se rompe no es el que tiene estudio jurídico.
Lo que hago yo mientras el juicio sigue
La salida fácil sería cerrar con «hay que regular». No la voy a usar, por dos razones.
La primera es que el juez Stein va a resolver cuando resuelva, probablemente en 2027, y ese fallo va a definir qué es fair use en Estados Unidos, no acá. La segunda es que ya vimos cómo se arma esa conversación cuando la abren los que fabrican los modelos, y en esa mesa no hay silla para nosotros.
Lo que sí está en nuestras manos es más chico y más útil.
- Seguir escribiendo, pero medir distinto. Si tu métrica es el clic, el número te va a deprimir y vas a dejar de publicar. Mirá otras señales: issues bien planteados, gente que llega sabiendo cosas que solo están en tu doc, menciones en otros repos.
- Poner la licencia explícita. En el blog, en el
README, en la doc. No frena a nadie por sí sola, pero es la diferencia entre «no dijo nada» y «dijo que no». Cuando esto se ordene, los que dejaron constancia van a estar mejor parados. - Decidir a conciencia qué dejás abierto. No es todo o nada. Podés querer que el crawler te lea (para que el modelo sepa que tu proyecto existe) y a la vez marcar qué partes no. Es una decisión de producto, no un trámite de
robots.txt. - Sostener los lugares donde la gente todavía va. La charla, el meetup, la lista de correo, el canal de la comunidad. Son formatos que el motor de respuestas no intercepta, porque no son una consulta: son una conversación.
Me quedé pensando en algo del memo de 2023. Hecht no escribió «esto es ilegal», escribió que la gente lo iba a percibir como un robo. Tres años después esa predicción se cumplió mejor que casi cualquier roadmap de producto.
Uso estos modelos todos los días y no pienso dejar de usarlos. Pero me parece sano acordarme de que están hechos con trabajo de alguien, y que una parte de ese alguien somos los que publicamos sin cobrar.
El doom loop no se corta con un fallo judicial. Se corta si el eslabón de adelante sigue teniendo motivos para escribir.


