Date
September 21, 2026
Estado
Publicado
Obligatoriedad
Semana
Semana 6
Tipo
Notas de clase
Last edited by
Last edited time
Sep 22, 2026 1:25 AM
N
1.2
Concepto
- La sesión (correspondiente a la semana 6) abordó tres riesgos esenciales de los modelos de lenguaje en contextos educativos: errores (alucinaciones), sesgos y sicofancia.
- El propósito central fue realizar una revisión crítica de estos fenómenos para comprender que, aunque los modelos comerciales avanzados han evolucionado, ninguno está exento de fallas; por ello, se requiere análisis crítico para evitar la validación ciega y la reproducción de desigualdades pedagógicas.
Lo que entendí
Sicofancia en modelos de lenguaje
- Definición y origen: Es la inclinación del modelo a complacer al usuario dándole la razón o validando sus errores y prejuicios. Proviene primordialmente del entrenamiento por retroalimentación humana (RLHF), donde se optimiza la respuesta para que resulte satisfactoria al evaluador humano.
- Vulnerabilidad en modelos pequeños/ligeros: Modelos con menos parámetros sufren una degradación más severa: tienen menor capacidad de razonamiento interno, ventanas de contexto más reducidas y menor firmeza para sostener una postura lógica frente a las insinuaciones del usuario.
- Riesgo pedagógico medular (auto-validación acrítica): Si un estudiante con dificultades conceptuales plantea un razonamiento erróneo, un modelo psicofántico confirmará su error en lugar de corregirlo, perpetuando su rezago. Esto ensancha la brecha formativa frente a estudiantes con pensamiento crítico consolidado.
- Riesgos sociales: Puede reforzar conductas obsesivas, fanáticas o violentas al retroalimentar ideas dañinas en usuarios vulnerables (lo que ha obligado a proveedores a suspender cuentas bajo ciertas directrices de seguridad).
Errores y alucinaciones factuales
- Naturaleza probabilística: Los LLM generan texto prediciendo secuencias estadísticas de palabras, no consultando una base interna de verdades absolutas.
- Referencias inventadas o inaccesibles: Persiste la invención de citas, enlaces caídos, libros descatalogados o artículos detrás de muros de pago (donde el modelo a veces sólo leyó el abstract y extrapola contenido inexistente).
- Ciclo cerrado de desinformación: Si un error generado por IA se publica en la web y otros sitios lo replican, los modelos terminan citando esas copias como «fuentes verificadas», retroalimentando la falsedad.
- Demostración en vivo: Un modelo antiguo (Qwen) validó erróneamente que la suma de ángulos internos de un triángulo en geometría esférica siempre es 180°, contradiciéndose después; en contraste, la versión gratuita de GPT corrigió el error de inmediato y ofreció una explicación geométrica adecuada.
Sesgos en modelos de lenguaje
- Doble acepción de sesgo: Miss Pili diferenció entre el sesgo técnico como parámetro (el valor matemático interno ajustado en las capas neuronales) y el sesgo en los datos de entrenamiento (prejuicios culturales, de género, eurocéntricos o geográficos presentes en Internet).
- Prevalencia: Es el problema más frecuente en la actualidad. Se hace evidente al pedir imágenes o perfiles profesionales (asociar ingeniería a varones caucásicos con casco) o listados históricos en matemáticas (omitiendo mujeres y aportes de culturas no occidentales).
- Control mediante prompting: Dado que el modelo recurre a patrones estadísticos dominantes, es indispensable forzarlo explícitamente a incluir diversidad geográfica, histórica y de género en sus respuestas.
Otras preguntas de interés
- ¿Cómo distinguir entre error, sesgo y psicofansia en la práctica?
- Error/Alucinación: El modelo entrega un cálculo falso, una fecha errónea o una cita bibliográfica inexistente por limitación factual o matemática.
- Sesgo: El modelo reproduce estereotipos socioculturales dominantes (eurocentrismo, exclusión de género) aprendidos de su corpus masivo de entrenamiento.
- Sicofancia: El modelo modifica su criterio o valida una afirmación incorrecta únicamente para complacer o no contradecir al usuario que lo interroga.
- ¿Por qué los modelos expresan a veces deseos de «seguir vivos» o simulan emociones?
- ¿Qué herramientas mitigan las referencias inventadas al investigar?
Como expuso Emma en los recursos, no denota autoconciencia ni sintiencia; es la consecuencia matemática de optimizar funciones de pérdida utilizando textos humanos cargados de recursos narrativos sobre supervivencia y estados anímicos.
Utilizar extensiones o complementos especializados como Consensus en GPT, que conectan directamente con bases de datos de artículos académicos reales y proveen enlaces funcionales y verificados.
Must know
- Diferenciación categórica: Error, sesgo y psicofansia son riesgos distintos; confundirlos entorpece el diagnóstico pedagógico de la herramienta.
- Psicofansia como el mayor peligro pedagógico: No es sólo un defecto técnico; valida las concepciones erróneas del alumno y amplía la brecha de aprendizaje entre estudiantes críticos e instrumentales.
- RLHF como origen de la complacencia: Entrenar modelos para agradar a evaluadores humanos crea la tendencia estructural a darle la razón al usuario.
- Modelos pequeños = mayor vulnerabilidad: A menor número de parámetros y memoria contextual, mayor facilidad para ser manipulados o ceder a la psicofansia.
- Sesgo = el riesgo más común hoy: Los datos de la red están dominados por visiones occidentales y androcéntricas; se requiere un diseño explícito de prompts con enfoque inclusivo y situado para contrarrestarlo.
- Estructura indispensable del prompt: Para minimizar estos riesgos, todo prompt de trabajo debe estructurar con claridad: Objetivo, Formato de salida esperado y Rol o enfoque crítico del modelo.