Pokee AI выпустила модель Pokee-Isaac 28B с контекстным окном до 10 млн токенов и запуском на одной видеокарте, начиная с RTX 4090. Модель доступна через API и для развертывания внутри периметра, включая VPC и собственные серверы.

Pokee AI представила модель Pokee-Isaac 28B с контекстным окном в 10 млн токенов. По данным компании, модель может работать на одной видеокарте, начиная с RTX 4090, а контекстное окно сохраняется по всей длине. Архитектура модели не является чисто декодерной: часть весов дообучена поверх Qwen3.6-27B под лицензией Apache 2.0, остальные обучены с нуля. На тесте RULER модель показала 96,9 на 256 тыс. токенов и 93,3 на 10 млн токенов. В агентных тестах Isaac заняла первое место на BFCL v4 (70,94) и τ³-bench (0,662), но уступила Luna в Terminal-Bench 2.1 (65,1 против 69,8). Модель доступна через API, а также для использования внутри периметра — в VPC, на собственных серверах или на устройстве. С первого дня она работает в vLLM и SGLang. Модель понимает только текст, попробовать её можно в консоли.

Источники 1
  • Pokee AI представила модель Pokee-Isaac 28B с контекстом 10 млн токенов Нейроканал
    Pokee AI выложила Pokee-Isaac 28B, модель с контекстом в 10 млн токенов, которая запускается на одной видеокарте, начиная с RTX 4090. Архитектура своя, не чисто декодерная: часть весов дообучена поверх Qwen3.6-27B под Apache 2.0, остальное обучено с нуля.
    
    Окно контекста рабочее по всей длине. На RULER модель даёт 96,9 на 256 тысячах токенов и 93,3 на десяти миллионах, а вся сравнительная панель (GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super, Qwen 3.5 122B) от миллиона токенов и дальше отдаёт нули, да их на такой длине и купить негде. В агентных тестах Isaac первый в панели на BFCL v4 (70,94) и τ³-bench (0,662), в Terminal-Bench 2.1 уступает Luna: 65,1 против 69,8.
    
    На одной B200 предзаполнение идёт со скоростью 137 200 токенов в секунду при полном десятимиллионном промпте, первый токен приходит через 72,9 секунды, генерация держится около 335 токенов в секунду что на миллионе контекста, что на десяти. Вход стоит 0,15 $ за миллион токенов, выход 1 $. Веса не выкладывают, модель отдают по API и лицензируют для запуска внутри своего периметра: VPC, свои серверы или устройство, с первого дня работает в vLLM и SGLang.
    
    На DTAP у модели лучшая в панели доля успешных атак, 35,6%, но в отчёте сразу оговариваются: явный отказ срабатывал только на 1,5% вредоносных задач, а на общем лидерборде из шестнадцати систем это пятое место по прямым атакам и шестое по непрямым. Понимает Isaac пока только текст, попробовать можно в консоли.
    
    @neuro_channel