Google работает над серверным чипом Frozen, в котором часть модели Gemini будет зафиксирована на уровне кремния. Проект рассчитан на инференс и может повысить энергоэффективность в 6–10 раз по сравнению с текущими AI-чипами.

По данным The Information, Google разрабатывает специализированный серверный чип под кодовым названием Frozen. В отличие от следующего поколения TPU, это более радикальный подход: часть модели Gemini предполагается «зашить» на уровне кремния. Чип предназначен прежде всего для инференса — генерации ответов уже обученной моделью, а не для обучения. Google рассчитывает получить в 6–10 раз больше токенов на единицу потреблённой энергии, чем на своих нынешних AI-чипах. Архитектура пока не утверждена: инженеры ещё решают, какая доля параметров Gemini будет физически зафиксирована в чипе. Обычно веса модели хранятся в HBM-памяти, постоянно считываются и передаются вычислительным блокам, что требует значительных затрат энергии и упирается в пропускную способность памяти. В Frozen часть весов или вычислительных структур хотят сделать постоянными, чтобы сократить обращения к памяти и заменить универсальные вычислительные блоки более простыми фиксированными схемами. Frozen разрабатывается как отдельная линейка, дополняющая TPU: TPU 8t предназначен для обучения моделей, TPU 8i — для более универсального инференса и AI-агентов, а Frozen — для дешёвого и массового обслуживания конкретного семейства Gemini.

Источники 1
  • Google разрабатывает специализированный чип Frozen для работы Gemini Метаверсище и ИИще
    Frozen v2
    
    Речь идёт не о мультике или следующем поколении TPU, а о гораздо более радикальном эксперименте Google - специализированном серверном чипе, в который часть модели Gemini будет буквально «зашита» на уровне кремния.
    
    Первое развёртывание планируется ориентировочно на 2028 год.
    Чип предназначен прежде всего для инференса - генерации ответов уже обученной моделью, а не для её обучения.
    По данным The Information, Google рассчитывает получить в 6-10 раз больше токенов на единицу потреблённой энергии, чем на своих нынешних AI-чипах.
    Архитектура пока не утверждена - инженеры ещё решают, какая доля параметров Gemini будет физически зафиксирована в чипе. 
    
    В чём фокус
    Обычно веса модели хранятся в HBM-памяти, постоянно считываются и передаются вычислительным блокам. Это расходует огромное количество энергии и упирается в пропускную способность памяти.
    В Frozen часть весов или вычислительных структур хотят сделать постоянными - условно превратить модель из программы, исполняемой процессором, в часть самого процессора. Так можно убрать множество обращений к памяти и заменить универсальные вычислительные блоки более простыми фиксированными схемами.
    Отсюда и название Frozen - часть модели «заморожена» в кремнии. 
    
    Это не замена TPU
    Frozen разрабатывается как отдельная линейка, дополняющая TPU:
    TPU 8t предназначен для обучения моделей.
    TPU 8i - для более универсального инференса и AI-агентов.
    Frozen - для чрезвычайно дешёвого и массового обслуживания конкретного семейства Gemini.
    
    https://www.reuters.com/business/google-plans-new-chip-run-gemini-models-more-efficiently-information-reports-2026-07-20/
    
    @cgevent