Velocidad, medida y publicada

No decimos que somos rápidos: lo medimos cada hora, contra nuestro propio proxy y contra el proveedor directamente, y publicamos las dos cifras. La diferencia entre ambas es lo que cuesta pasar por nosotros.

Todavía sin mediciones

Aún no hay mediciones publicadas. La sonda corre cada hora.

Metodología

Cada hora lanzamos 3 peticiones por modelo, con el mismo prompt de unos 800 tokens de entrada y un máximo de 600 de salida, a temperatura 0.7 para que ninguna respuesta salga de la caché. El tiempo hasta el primer token se mide en el primer fragmento que trae texto, no en el primer byte. Las mismas peticiones se repiten contra el proveedor directamente, desde la misma región.

El código de la sonda está en el repositorio: core/app/bench/probe.py