{"id":91374,"date":"2025-09-09T09:56:01","date_gmt":"2025-09-09T09:56:01","guid":{"rendered":"https:\/\/enfoquenoticioso.com\/?p=91374"},"modified":"2025-09-09T09:56:01","modified_gmt":"2025-09-09T09:56:01","slug":"ya-sabemos-por-que-alucina-la-ia-por-lo-mismo-que-a-los-estudiantes-les-gusta-hacer-quinielas-con-sus-examenes","status":"publish","type":"post","link":"https:\/\/enfoquenoticioso.com\/?p=91374","title":{"rendered":"Ya sabemos por qu\u00e9 alucina la IA. Por lo mismo que a los estudiantes les gusta hacer quinielas con sus ex\u00e1menes"},"content":{"rendered":"<div>\n<p>La IA alucina. <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/pregunta-no-ia-se-ha-estancado-pregunta-que-pasa-ha-hecho\" data-vars-post-title=\"Los esc\u00e9pticos de la IA avisaron de que nos est\u00e1bamos emocionando mucho y no les cre\u00edmos: la IA es tont\u00edsima\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/pregunta-no-ia-se-ha-estancado-pregunta-que-pasa-ha-hecho\" target=\"_blank\" rel=\"noopener\">Da respuestas que no son ciertas<\/a>. Inventa, y adem\u00e1s lo hace con una soltura sencillamente asombrosa. Las respuestas parecen coherentes gracias a esa aparente coherencia y seguridad, pero lo cierto es que eso puede acabar provocando problemas inquietantes. Por ejemplo, que te recomiende <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/ia-google-aconseja-usar-pegamento-queso-pizza-fuente-comentario-reddit-hace-11-anos\" data-vars-post-title=\"La IA de Google aconseja usar pegamento para el queso de la pizza. La fuente es un comentario de Reddit de hace 11 a\u00f1os \" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/ia-google-aconseja-usar-pegamento-queso-pizza-fuente-comentario-reddit-hace-11-anos\" target=\"_blank\" rel=\"noopener\">poner pegamento en la pizza<\/a> para que el queso quede bien pegado.<\/p>\n<p><strong>Las alucinaciones no son un error m\u00edstico<\/strong>. En OpenAI conocen bien el problema, y acaban de <a rel=\"noopener, noreferrer\" href=\"https:\/\/cdn.openai.com\/pdf\/d04913be-3f6f-4d2b-b283-ff432ef4aaa5\/why-language-models-hallucinate.pdf\" target=\"_blank\">publicar un informe<\/a> en el cual analizan las causas de las alucinaciones. Seg\u00fan el estudio, estas surgen por \u00abpresiones estad\u00edsticas\u00bb en las etapas de entrenamiento y evaluaci\u00f3n.\u00a0<\/p>\n<p><!-- BREAK 1 --> <\/p>\n<div class=\"article-asset article-asset-normal article-asset-center\">\n<div class=\"desvio-container\">\n<div class=\"desvio\">\n<div class=\"desvio-figure js-desvio-figure\">\n    <a href=\"https:\/\/www.xataka.com\/robotica-e-ia\/tenemos-problema-opacidad-ia-gpt-5-tiene-muchas-versiones-openai-decide-cual-usar-ti\" class=\"pivot-outboundlink\" data-vars-post-title=\"Buenas noticias, ya no tienes que elegir modelo utilizando GPT-5. Malas noticias, es GPT-5 quien lo elige sin avisarte\" target=\"_blank\" rel=\"noopener\"><br \/>\n     <img loading=\"lazy\" decoding=\"async\" alt=\"Buenas noticias, ya no tienes que elegir modelo utilizando GPT-5. Malas noticias, es GPT-5 quien lo elige sin avisarte\" width=\"375\" height=\"142\" src=\"https:\/\/i.blogs.es\/76ce94\/chat2\/375_142.jpeg\"\/><br \/>\n    <\/a>\n   <\/div>\n<\/p><\/div>\n<\/p><\/div>\n<\/div>\n<p><strong>Premio por adivinar<\/strong>. El problema, explican, es que en esos procedimientos se est\u00e1 premiando que la IA \u00abadivine\u00bb en lugar de admitir que puede haber incertidumbre en las respuestas, \u00abcomo cuando un estudiante se enfrenta a una pregunta dif\u00edcil en un examen\u00bb y responde a alguna de las opciones disponibles <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/le-pides-a-ia-que-elija-numero-1-50-suele-elegir-27-razon-muy-humana\" data-vars-post-title=\"Si le pides a las IAs que elijan un n\u00famero entre 1 y 50, suelen elegir el 27. La raz\u00f3n es muy humana\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/le-pides-a-ia-que-elija-numero-1-50-suele-elegir-27-razon-muy-humana\" target=\"_blank\" rel=\"noopener\">para ver si tiene suerte y acierta<\/a>. En OpenAI se\u00f1alan c\u00f3mo la IA hace algo parecido en esos casos, y en el entrenamiento se la anima a contestar adivinando la respuesta en lugar de contestar con un sencillo \u00abno lo s\u00e9\u00bb.<\/p>\n<p><strong>Malditas probabilidades<\/strong>. En la fase de pre-entrenamiento los modelos aprenden la distribuci\u00f3n del lenguaje a partir de un gran corpus de texto. Y es ah\u00ed donde los autores destacan que aunque los datos de origen est\u00e9n completamente libres de errores, <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/hay-nueva-forma-comprobar-tu-ia-lista-no-ponerla-a-jugar-a-pokemon\" data-vars-post-title=\"El nuevo &quot;test&quot; para descubrir si un modelo de IA o no es verdaderamente inteligente: ponerle a jugar a Pok\u00e9mon\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/hay-nueva-forma-comprobar-tu-ia-lista-no-ponerla-a-jugar-a-pokemon\" target=\"_blank\" rel=\"noopener\">las t\u00e9cnicas estad\u00edsticas que se utilizan<\/a> provocan que el modelo pueda cometer errores. La generaci\u00f3n de un texto v\u00e1lido es mucho m\u00e1s compleja que responder a una simple pregunta con un s\u00ed o un no como \u00ab\u00bfes v\u00e1lida esta salida?\u00bb.<\/p>\n<p><strong>Predecir la palabra tiene trampa<\/strong>. Los modelos de lenguaje aprenden a \u00abhablar\u00bb con el preentrenamiento, en el que aprenden a predecir la pr\u00f3xima palabra de una frase gracias a la ingesta de enormes cantidades de texto. Aqu\u00ed no hay etiquetas \u00abverdadero\/falso\u00bb en cada frase con la que se entrena, solo \u00abejemplos positivos\u00bb (v\u00e1lidos) del lenguaje. Eso hace m\u00e1s dif\u00edcil evitar las alucinaciones, pero en OpenAI creen tener una posible respuesta que de hecho ya han aplicado en <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/gpt-5-esta-aqui-asi-lanzamiento-inteligencia-artificial-esperado-openai-carrera-cada-vez-renida\" data-vars-post-title=\"OpenAI lanza GPT-5: un enorme modelo &quot;unificado&quot; con el que la empresa aspira a dar un gran salto respecto a los anteriores\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/gpt-5-esta-aqui-asi-lanzamiento-inteligencia-artificial-esperado-openai-carrera-cada-vez-renida\" target=\"_blank\" rel=\"noopener\">GPT-5<\/a>.<\/p>\n<p><strong>Un nuevo entrenamiento<\/strong>. Para mitigar el problema en OpenAI proponen introducir una clasificaci\u00f3n binaria que ellos llaman \u00abIs-It-Valid\u00bb (IIV, \u00ab\u00bfEs v\u00e1lida?\u00bb), que entrena a un modelo para distinguir entre respuestas v\u00e1lidas y err\u00f3neas.\u00a0<\/p>\n<p><!-- BREAK 2 --><\/p>\n<div class=\"article-asset-image article-asset-normal article-asset-center\">\n<div class=\"asset-content\">\n                   <img class=\"centro_sinmarco\" height=\"668\" width=\"1088\" loading=\"lazy\" decoding=\"async\" sizes=\"auto, 100vw\" fetchpriority=\"high\" srcset=\"https:\/\/i.blogs.es\/e9a49c\/captura-de-pantalla-2025-09-08-a-las-13.35.49\/450_1000.jpeg 450w, https:\/\/i.blogs.es\/e9a49c\/captura-de-pantalla-2025-09-08-a-las-13.35.49\/650_1200.jpeg 681w,https:\/\/i.blogs.es\/e9a49c\/captura-de-pantalla-2025-09-08-a-las-13.35.49\/1024_2000.jpeg 1024w, https:\/\/i.blogs.es\/e9a49c\/captura-de-pantalla-2025-09-08-a-las-13.35.49\/1366_2000.jpeg 1366w\" src=\"https:\/\/i.blogs.es\/e9a49c\/captura-de-pantalla-2025-09-08-a-las-13.35.49\/450_1000.jpeg\" alt=\"Captura De Pantalla 2025 09 08 A Las 13 35 49\"\/><br \/>\n   <img decoding=\"async\" alt=\"Captura De Pantalla 2025 09 08 A Las 13 35 49\" class=\"centro_sinmarco\" src=\"https:\/\/i.blogs.es\/e9a49c\/captura-de-pantalla-2025-09-08-a-las-13.35.49\/450_1000.jpeg\"\/><\/p><\/div>\n<\/div>\n<p><strong>GPT-5 es algo m\u00e1s humilde<\/strong>. Cuando hay una respuesta correcta, los modelos de OpenAI clasifican las respuestas que da el modelo en tres grupos: correctas, errores, y abstenciones, que reflejan cierta \u00abhumildad\u00bb. Seg\u00fan sus datos, GPT-5 ha mejorado en cuanto a la tasa de alucinaciones porque en sus pruebas se abstiene mucho m\u00e1s (52%) que o4-mini (1%), por ejemplo.\u00a0Aunque o4-mini es ligeramente mejor en respuestas correctas, <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/alucinaciones-siguen-siendo-talon-aquiles-ia-ultimos-modelos-openai-inventan-cuenta\" data-vars-post-title=\"Las alucinaciones siguen siendo el tal\u00f3n de Aquiles de la IA: los \u00faltimos modelos de OpenAI inventan m\u00e1s de la cuenta\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/alucinaciones-siguen-siendo-talon-aquiles-ia-ultimos-modelos-openai-inventan-cuenta\" target=\"_blank\" rel=\"noopener\">es mucho peor en tasa de errores<\/a>.<\/p>\n<p><strong>Los benchmarks premian los aciertos<\/strong>. En el estudio se indica adem\u00e1s c\u00f3mo <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/no-sabemos-que-miden-exactamente-benchmarks-ia-asi-que-hemos-hablado-espanol-que-ha-creado-uno-dificiles\" data-vars-post-title=\"No sabemos qu\u00e9 miden los benchmarks de IA. As\u00ed que hemos hablado con el espa\u00f1ol que ha creado uno de los m\u00e1s dif\u00edciles\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/no-sabemos-que-miden-exactamente-benchmarks-ia-asi-que-hemos-hablado-espanol-que-ha-creado-uno-dificiles\" target=\"_blank\" rel=\"noopener\">los benchmarks<\/a> y las tarjetas t\u00e9cnicas de los modelos (model cards) actuales se centran totalmente en la tasa de aciertos. De ese modo, aunque los modelos de IA efectivamente mejoran y aciertan cada vez m\u00e1s, siguen alucinando y no hay apenas datos sobre esas tasas de alucinaciones que deber\u00edan sustituirse por un simple \u00abno lo s\u00e9\u00bb.\u00a0<\/p>\n<p><!-- BREAK 3 -->  <\/p>\n<p><strong>Soluci\u00f3n f\u00e1cil<\/strong>. Pero como ocurre en los ex\u00e1menes tipo test, hay una forma de evitar que <a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/mito-alumno-que-aprueba-examen-estudiando-tres-dias-antes-real-gracias-a-chatgpt\" data-vars-post-title=\"Un sobresaliente estudiando el d\u00eda de antes: ChatGPT est\u00e1 acelerando la muerte de los ex\u00e1menes\" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/mito-alumno-que-aprueba-examen-estudiando-tres-dias-antes-real-gracias-a-chatgpt\" target=\"_blank\" rel=\"noopener\">los alumnos jueguen a la quiniela<\/a>: penalizar los errores m\u00e1s que la incertidumbre. En esos ex\u00e1menes contestar bien puede valer un punto pero contestar mal puede restar 0,5 puntos y no contestar valdr\u00eda cero puntos. Si no sabes la respuesta, adivinar te puede salir muy caro. Pues con los modelos de IA, igual.\u00a0<\/p>\n<p>En Xataka |\u00a0<a class=\"text-outboundlink\" href=\"https:\/\/www.xataka.com\/robotica-e-ia\/tenemos-problema-ia-no-hay-forma-fiable-saber-chatgpt-mejor-que-gemini-copilot-claude\" data-vars-post-title=\"Tenemos un problema con la IA: no hay forma fiable de saber si ChatGPT es mejor que Gemini, Copilot o Claude \" data-vars-post-url=\"https:\/\/www.xataka.com\/robotica-e-ia\/tenemos-problema-ia-no-hay-forma-fiable-saber-chatgpt-mejor-que-gemini-copilot-claude\" target=\"_blank\" rel=\"noopener\">Tenemos un problema con la IA: no hay forma fiable de saber si ChatGPT es mejor que Gemini, Copilot o Claude<\/a><\/p>\n<p><!-- BREAK 4 --><\/p><\/div>\n<p><a href=\"https:\/\/www.xataka.com\/robotica-e-ia\/openai-cree-haber-descubierto-porque-ias-alucinan-no-saben-decir-no-se\" class=\" target=\" title=\"Ya sabemos por qu\u00e9 alucina la IA. Por lo mismo que a los estudiantes les gusta hacer quinielas con sus ex\u00e1menes\" target=\"_blank\" rel=\"noopener\">Ver fuente<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>La IA alucina. Da respuestas que no son ciertas. Inventa, y adem\u00e1s lo hace con una soltura sencillamente asombrosa. Las respuestas parecen coherentes gracias a esa aparente coherencia y seguridad, pero lo cierto es que eso puede acabar provocando problemas inquietantes. Por ejemplo, que te recomiende poner pegamento en la pizza para que el queso [&hellip;]<\/p>\n","protected":false},"author":2,"featured_media":91375,"comment_status":"open","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[9],"tags":[],"class_list":["post-91374","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-tecnologia"],"_links":{"self":[{"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=\/wp\/v2\/posts\/91374","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=91374"}],"version-history":[{"count":0,"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=\/wp\/v2\/posts\/91374\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=\/wp\/v2\/media\/91375"}],"wp:attachment":[{"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=91374"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=91374"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/enfoquenoticioso.com\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=91374"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}