Date
September 14, 2026
Estado
Publicado
Obligatoriedad
Semana
Semana 5
Tipo
Notas de clase
Last edited by
Last edited time
Sep 15, 2026 1:21 AM
N
1.1
Concepto
- Los Transformers son un tipo de arquitectura de redes neuronales que procesan secuencias de entrada para transformarlas en una secuencia de salida, aprendiendo las relaciones y el contexto entre los componentes de dicha secuencia .
Lo que entendí
- Componentes Básicos: Las redes neuronales utilizan parámetros como pesos y sesgos (bias) para definir la activación de las neuronas artificiales.
- Tipos de Transformers:
- Codificadores (Encoder): Ejemplo BERT, que es bidireccional y se utiliza principalmente para clasificar, etiquetar o predecir palabras enmascaradas dentro de un contexto.
- Decodificadores (Decoder): Ejemplo GPT, que es unidireccional y generativo, prediciendo la siguiente palabra en una secuencia.
- Híbridos: Ejemplo BART, que combina capacidades bidireccionales y autorregresivas .
- Tokens: Son la unidad mínima de procesamiento para el modelo (como un átomo); pueden ser palabras, sílabas o signos. El costo y el procesamiento de la IA se miden generalmente en tokens.
- Ventana de Contexto y Atención: La capacidad de un modelo para recordar relaciones en secuencias largas se llama atención. Cuando la conversación es muy extensa, la atención puede disminuir, provocando errores o confusiones.
- Buenas Prácticas en Prompts:
- Se recomienda editar el prompt inicial en lugar de pedir correcciones sucesivas para evitar sobrecargar la ventana de contexto con errores previos .
- No es necesario ser excesivamente amable (usar "por favor" o "gracias") en cada instrucción, ya que no mejora el resultado técnico .
- Personalización de GPT: Es posible configurar instrucciones personalizadas para que la IA sea más crítica y no simplemente dé la razón al usuario, evitando así el refuerzo de sesgos.