OpenAI teste un nouveau mode d'inférence Ultrafast destiné aux applications sensibles à la latence.

GPT-5.4 Mini pourrait atteindre jusqu'à 1 000 tokens par seconde, selon l'entreprise.

Source

OpenAI — Previewing Ultrafast mode