Los lectores calificaron las historias cortas de IA mejor que las humanas, hasta que les dijeron que las había escrito una máquina
En tres experimentos con más de 2500 personas, los lectores no tuvieron más que una oportunidad para detectar la ficción de ChatGPT. Las historias de IA obtuvieron puntuaciones más altas en calidad e inmersión, y la etiqueta por sí sola fue suficiente para bajar las puntuaciones.
Un nuevo estudio publicado en la revista Judgment and Decision Making puso a más de 2.500 personas frente a historias cortas y les pidió que detectaran la máquina. No pudieron. En tres experimentos, los participantes no obtuvieron mejores resultados que lanzar una moneda al aire, y las historias escritas por IA obtuvieron calificaciones más altas que las humanas, al menos mientras los lectores creían que las había escrito una persona.
Los investigadores Sydney Sears y Deena Skolnick Weisberg realizaron el primer experimento con 1.682 participantes. Cada uno leyó una historia de unas 1.000 palabras. Tres de los seis procedían de revistas literarias y colecciones de cuentos establecidas. Los otros tres se generaron con ChatGPT y se les pidió que coincidieran con el tema, el estilo y la perspectiva narrativa de los originales humanos. A la mitad de los lectores se les dijo que un humano escribió el artículo, a la otra mitad se les dijo que ChatGPT lo hizo. Esa etiqueta era precisa sólo para la mitad de cada grupo, que es lo que hace que el diseño sea útil: separa lo que hace el texto de lo que espera el lector.
En una escala de menos 3 a más 3, las historias de IA obtuvieron una puntuación de 1,54 en calidad percibida frente a 0,97 de las humanas, y 1,42 frente a 1,00 en inmersión. La etiqueta importaba de forma independiente. Quienquiera que lo hubiera escrito, los lectores dieron puntuaciones más altas cuando se les dijo que el autor era humano. Los lectores a quienes les gustaba la IA en general calificaron todo mejor y subieron aún más cuando se les dijo que era ChatGPT. Entre los lectores escépticos de la IA, el efecto fue el contrario. En otros dos experimentos con 905 personas, los participantes leyeron una historia humana y otra de IA, una al lado de la otra, y tuvieron que decir cuál era cuál. Incluso con una comparación directa, tenían posibilidades.
Antes de que alguien concluya que ChatGPT escribe mejor ficción que los novelistas, los autores ofrecen una explicación desinfladora y probablemente sea la correcta. La prosa de IA tiende a ser más fluida, más fácil de leer y más optimista emocionalmente, y la gente prefiere cosas que sean fáciles de procesar. La ficción literaria seria a menudo hace lo contrario a propósito, haciéndote trabajar por el significado. Una historia puede ser de gran calidad y no muy agradable de contar. El formato de 1.000 palabras también favorece a la máquina, ya que mantener una historia en una página es un problema diferente a mantener una en 300. La experiencia con herramientas de inteligencia artificial se correlaciona con la detección de falsificaciones. La experiencia con la ficción no.
Qué significa esto para ti: la conclusión práctica no es que la IA escriba bien, sino que no puedes reconocer su origen solo leyendo. Por tanto, confiar en tu propio detector está fuera de lugar. Si encargas o publicas textos, juzga el trabajo por lo que consigue y pregunta directamente cómo se produjo, en vez de intentar adivinarlo. Si escribes, el hallazgo es más alentador de lo que parece: la fluidez y la recompensa emocional inmediata ayudaron a las historias de IA en el estudio, pero también son cualidades que vuelven olvidable una prosa. Si simplemente lees, fíjate en cuánto dependió tu disfrute de una etiqueta y no de las palabras. Eso dice algo sobre todos nosotros. Los datos y materiales están disponibles en Open Science Framework, así que puedes leer las historias y juzgarlas por tu cuenta.
Fuentes
- Juicio y Toma de Decisiones: ¿Bot o no? ¿Puede la gente distinguir entre historias escritas por un ser humano o por un sistema de inteligencia artificial?
- Marco de ciencia abierta: datos y materiales de estudio
- The Decoder: Los lectores valoran más las historias cortas generadas por IA que las humanas
El nuevo modelo de imagen de xAI ocupa el segundo lugar en el ranking Arena y lleva la edición estilo Photoshop a Grok
Imagine Image 2.0 obtiene una puntuación justo detrás de GPT-Image-2 de OpenAI en ambas tablas de clasificación públicas. La parte más interesante son las herramientas de edición, que señalan hacia dónde se dirige realmente la IA de la imagen.