Qué es un modelo de lenguaje, sin jerga
- 01Predecir la palabra siguiente, nada más6 min
Un modelo de lenguaje solo hace una cosa: predecir el fragmento de texto más probable a continuación de lo que ya ha leído, y una respuesta inventada sale del mismo cálculo que una respuesta exacta, sin que ninguna señal interna las distinga la una de la otra.
- 02El token y la ventana, lo que el modelo ve realmente7 min
El modelo ve tokens apilados en una ventana con un techo fijo, no palabras enteras tomadas una por una, y una conversación que se acerca a ese techo cambia de contenido incluso antes de alcanzar su coste máximo, ya que Claude entonces resume los intercambios más antiguos.
- 03El mito del ajuste mágico6 min
Dos respuestas diferentes a la misma pregunta no indican una avería: vienen de un ajuste interno, la temperatura, que regula el nivel de riesgo en la elección de la palabra siguiente, y ese ajuste no corrige una petición mal planteada, la petición misma sí puede hacerlo.
- 04Una familia de modelos, una elección entre velocidad y profundidad7 min
Los modelos de una misma familia comparten el mismo entrenamiento base y solo se diferencian realmente por el equilibrio entre la velocidad de la respuesta y la profundidad del razonamiento aplicado antes de responder.
- 05El sentido sin diccionario, y por qué el orden importa6 min
Claude no abre ningún diccionario, asocia cada palabra a palabras de sentido cercano y evalúa cada una en relación con todas las demás en el momento de responder, lo que hace que el lugar de una instrucción dentro del mensaje cambie su peso real en la respuesta.
- 06Cómo aprendió Claude a responder, y hasta cuándo7 min
Claude atraviesa tres etapas de entrenamiento antes de cualquier conversación, una lectura amplia del mundo, un ajuste para convertirse en un asistente útil, y después una autocorrección basada en principios escritos, y el conocimiento que resulta de ello se detiene en una fecha que varía según el modelo utilizado.