OpenAI показали, чем занималась её следующая модель Astra: она выдала доказательства для 10 открытых задач по математике и теории вычислений. Кажется, у моделей появился новый бенчмарк: искать достаточно громкие открытые проблемы, чтобы решение красиво смотрелось в пресс-релизе. Сегодня — 10 «важных» теорем. Перед GPT‑7, видимо, придётся найти лекарство от рака, перед GPT‑8 — управляемый термояд, а перед GPT‑9 — доказать, что люди не особо-то и нужны. Шутки шутками, результаты реальные и проверяемые. Но сама гонка «каждый релиз должен решить что-то историческое» уже немного напоминает натягива

OpenAI показали, чем занималась её следующая модель Astra: она выдала доказательства для 10 открытых задач по математике и теории вычислений. Кажется, у моделей появился новый бенчмарк: искать достаточно громкие открытые проблемы, чтобы решение красиво смотрелось в пресс-релизе. Сегодня — 10 «важных» теорем. Перед GPT‑7, видимо, придётся найти лекарство от рака, перед GPT‑8 — управляемый термояд, а перед GPT‑9 — доказать, что люди не особо-то и нужны. Шутки шутками, результаты реальные и проверяемые. Но сама гонка «каждый релиз должен решить что-то историческое» уже немного напоминает натягивание совы на глобус🤔 P.S. это касается и историй о масштабных взломах крупных компаний во время закрытых тестов

Источники 1