Descubre cómo controlar el esfuerzo de reflexión de los modelos y supervisar la ventana de contexto y el consumo de tokens en tiempo real.
1. Modelos con Capacidad de Razonamiento
Los modelos de última generación (como DeepSeek-R1, OpenAI o1/o3-mini, Claude 3.7 Sonnet con thinking o Qwen QwQ) generan una cadena de pensamiento interna previa a emitir su respuesta final.
ZeroChat captura estos fragmentos de pensamiento en tiempo real (reasoning_content / thinking) a través de los adaptadores de proveedor y los presenta en un bloque visual independiente y colapsable en el chat.
El Selector de Nivel de Razonamiento
En la barra inferior del composer encontrarás un indicador de velocímetro. Su aguja refleja la intensidad elegida; al pulsarlo se abre un panel compacto con una barra de intensidad y un cierre X.
Ninguno: No se envía ninguna configuración de razonamiento; es la opción adecuada para respuestas rápidas y concisas.
Bajo a Máximo: Desliza la barra para graduar el esfuerzo de razonamiento según la complejidad de la tarea.
Compatibilidad: ZeroChat adapta el nivel al formato que entiende el proveedor. Si el modelo no admite razonamiento, continúa con una respuesta normal.
Punto de Control Agéntico (agent_checkpoint): En el menú de razonamiento puedes activar esta herramienta especial. Permite al modelo guardar reflexiones o hallazgos clave antes de ejecutar acciones complejas o búsquedas documentales.
2. El Hub Unificado de Telemetría (Context Hub)
Junto al selector de perfil se muestra un botón indicador de telemetría (por ejemplo, 1.4k / 128k). Este botón sintetiza la salud de la ventana de contexto de la conversación activa mediante un código de colores tipo semáforo:
Verde (Óptimo): Menos del 75% de la capacidad de contexto utilizada.
Ámbar (Advertencia): Entre el 75% y el 90% de la capacidad consumida. Conviene podar mensajes o ramificar la conversación.
Rojo (Crítico): Por encima del 90% del límite del modelo. Riesgo inminente de truncado o fallo en la API.
3. Métricas Detalladas del Popover de Telemetría
Al pulsar sobre la píldora de tokens, se despliega el Context Hub Popover, ofreciendo tres secciones de diagnóstico exhaustivo:
Sección 1: Ventana de Contexto Global
Barra de progreso visual: Muestra el porcentaje exacto de ocupación de la ventana de contexto.
Tokens usados, capacidad y disponibles: Cifras exactas calculadas con el tokenizer y las respuestas del servidor.
Ajuste de capacidad asumida: Si tu servidor local no anuncia su límite de contexto o deseas limitar artificialmente la ventana (por ejemplo, a 8k o 32k), puedes escribir el valor y pulsar "Usar" para ajustar el semáforo al instante.
Sección 2: Ahorro por Caché de Contexto (Prompt Caching / KV)
En modelos que soportan reutilización de prefijos (como Anthropic Claude, OpenAI o DeepSeek):
Tokens leídos de caché (Ahorro): Tokens recuperados de la memoria intermedia del proveedor sin coste completo o con descuento masivo de latencia y precio.
Tokens escritos en caché: Bloques recién indexados para acelerar los siguientes turnos de la sesión.
Sección 3: Rendimiento del Último Turno
Tokens de entrada (Prompt) y salida (Completion): Desglose exacto del último mensaje intercambiado.
Velocidad de generación: Medida en tokens por segundo (t/s).
Latencia TTFT (Time To First Token): Tiempo transcurrido en milisegundos desde que envías el mensaje hasta que el servidor emite el primer token útil.