OpenAI рассказала, что модель GPT-5.6 Sol помогла переписать ядра для GPU и снизить стоимость обслуживания на 20%. Также эффективность генерации токенов выросла более чем на 15%.

OpenAI рассказала, как удешевляла GPT-5.6, и большую часть этой работы выполнила сама GPT-5.6 Sol. Sol в Codex переписывала ядра — код, который считает математику модели на GPU: искала, что можно вычислить заранее, чего избежать и что распараллелить. Для этого модель специально учили писать на Triton и Gluon. В результате стоимость обслуживания снизилась на 20%. Кроме того, Sol собрала черновую модель для спекулятивного декодирования: маленькая модель работает рядом с основной и предлагает токены заранее, а основная проверяет их за один проход. Sol провёл сотни экспериментов с архитектурой и сам следил за обучением. В итоге эффективность генерации токенов выросла более чем на 15%. В сообщении также отмечается, что на практике это должно сделать лимиты более заметными по размеру: для тех же задач модель будет тратить меньше ресурсов.

Источники 1
  • OpenAI снизила стоимость обслуживания GPT-5.6 с помощью модели Sol Нейроканал
    OpenAI рассказала, как удешевляла GPT-5.6, и занималась этим в основном сама GPT-5.6 Sol.
    
    Sol в Codex переписывал ядра, код, который считает математику модели на GPU: искал, что можно вычислить заранее, чего избежать и что распараллелить. Модель для этого специально учили писать на Triton и Gluon. Стоимость обслуживания упала на 20%.
    
    Ещё Sol собрал себе черновую модель для спекулятивного декодирования: маленькая модель бежит рядом с основной и предлагает токены вперёд, а основная проверяет их за один проход. Sol прогнал сотни экспериментов с её архитектурой и сам присматривал за обучением. Генерация токенов стала эффективнее больше чем на 15%.
    
    На практике для нас обещают, что лимиты будут ощущаться как большие, чем были, модель будет тратить на те же задачи меньше.
    
    Это круто, конечно, но по мне так главное отучить Sol слишком долго работать. Итерации это хорошо, но часто он не знает меры и может сутками работать пока не достигнет цели. Достигает в итоге и даже подписки на это хватает, но Opus до тех же результатов куда быстрее доходит.
    
    @neuro_channel