epsiloncorrect 221 Telegram Group

epsilon correct

Вчера суд Массачусетса вынес решение отклонить иск Франчески Джино к Гарварду и коллективу DataColada, который раскрыл фальсификации в нескольких работах Франчески. Этот скандал с фальсификациями – самый громкий за последние несколько лет: Джино была одним из ведущих учёных-бихевиористов, её работы были классикой в области. Дополнительную перчинку придаёт скандалу название её книги, вышедшей за пару лет до разоблачения: "Rebel talent: Why it pays to break the rules at work and in life". Такая вот ирония судьбы. 🤔

Мне кажется решение довольно важным в контексте прецедентности: расследовать чужой фрод в исследованиях – можно и нужно, в науке должно быть больше разоблачений плохих методов и сомнительных практик. Один из моих любимых блогов по теме ведёт Лиор Пахтер, который знатно проезжался по сомнительно известному в узких кругах исследователю графов Альберту-Ласло Барабаши.

А в ваших областях существуют такие правдорубы? Приглашаю обсудить в комментариях. 👀

Please open Telegram to view this post

VIEW IN TELEGRAM

17.5K views11:02

epsilon correct

У конкурентов анонс: выпустили новые модельки o1 и o1-mini с серьёзным CoT. Как Reflection, только не мем, а реально рабочее. Самые большие приросты на сложных задачах олимпиадно-университетского уровня. Без скатывания канала в совсем бестолковую аналитику, хочется сразу пару наблюдений:

1. Очень дорогой инференс, порядка 100 раз увеличения затрат. Для простых работяг пока лимиты 30 сообщений в неделю (!). Придётся учиться формулировать весь запрос за раз. 😰

2. Мы всё дальше отходим от сравнимости моделей. Хотя для кодинга и существует арена, доверять простым людям на LLM-арене становится всё проблематичнее. Особенно тяжело сравнивать в околонаучных задачах, где мало бенчмарков, на которых согласны бенчмаркать люди.

3. Модели всё больше разделяются на “болталки” и профессиональные. Я об этом уже писал раньше, и вот теперь стало совсем понятно, что никаких клубничек в продуктах не будет.

4. Этот результат – заслуга пост-тренинга. Показывает, насколько много чего в моделях мы ещё даже не понимаем, как использовать (другими примером за последний месяц был Gemini 1.5 Pro-0827, который сильно вырвался по бенчмаркам относительно майской модели).

Вот тут можно найти o1 system card, где должно быть больше деталей (кроме самого интересного, конечно).

Please open Telegram to view this post

VIEW IN TELEGRAM

5.5K viewsedited 17:39

epsilon correct

Пример решения довольно нетривиальной задачки, с которой текущие модели не справляются

30.1K views18:01

epsilon correct

Впечатления от Remarkable Paper Pro

Чуть больше недели назад Remarkable анонсировал последнее поколение своих e-ink планшетов – теперь в цвете! Я не смог удержаться от заказа: как мне казалось, от чтения статей на e-ink меня останавиливало только то, что графику и эксперименты было видно ужасно. Мелкие формулы на обычном kindle, с которого я читаю книжки, тоже читать довольно напряжно. К сожалению, технологии до сих пор не преодолели какого-то порога удобства, по крайней мере для меня. 🤓

Сначала про хорошее: девайс монофункциональный, никаках чёрно-белых инстаграмов в нём не привидится, при пользовании придётся не отвлекаться. В этом смысле девайсу жирный плюс, что не ушли от изначального концепта ради поднятия метрик использования планшета. Во-творых, писать на нём реально удобно: буковки появляются при написании практически сразу, сохраняются и синхронизируются тоже почти моментально. В целом, это было и в предыдущих версиях этого планшета, но всё-таки приятно, что продукт продолжают полировать. 👍

Теперь минусы. Их, к сожалению, настолько больше, что рекомендовать этот девайс я не могу никому. Во-первых, не исправили проблему с зумом – скорость отвратительная, а тачпад не распознаёт все движения. В результате user experience получается 🤬очень бесящий. Остались надежда только на daylight computer, ну или не выпендриваться и продолжать читать на айпаде. Во-вторых, передача цветов очень сильно хромает. Для сравнения на фото (за качество вы уж извините, телеграм ужасно жмёт) справа – скриншот из моей статьи, где я цветами что-то показываю; слева – то, как это видно на Remarkable Paper Pro. Все цвета слились в один, смысл картинки полностью потерялся. Графики с множеством цветных линий, так популярные в нашем с вами машинлёрнинге, тоже читаются очень плохо. При письме цвета не получаются натуральными, так ещё и при стирании оставляют за собой след до полного обновления экрана; меня как перфекциониста такое просто вымораживает. В результате основной функционал девайса превращается в UX-пытку.

Зачем я вообще этим делюсь? В медия планшет получил восторженные отзывы от всяких изданий, а мне как-то вообще не зашло. Надеюсь, кому-нибудь смогу сэкономить немножно денег. Если вам понравился данный формат постов, дайте знать в комментариях: я всегда могу написать обзор на вилки. 🔪

Please open Telegram to view this post

VIEW IN TELEGRAM

5.2K views11:09

epsilon correct

CVPR – крупнейшая в мире конференция по компьютерному зрению – анонсировала несколько существенных изменений процесса подачи и рецензирования статей. CVPR – конференция крупнейшая не только в компьютерном зрении, но и вообще в мире. Например, она занимает второе место в мире по цитируемости, аккурат после Nature.

Во-первых, всех авторов статей заставят рецензировать. В более лёгком формате такая система уже работает на конференциях типа NeurIPS и ICLR, вот только там заставляют рецензировать хотя бы одного автора. Интересно, что станет с нагрузкой на рецензентов: по идее, она может очень существенно снизиться в результате такого нововведения.

Во-вторых, если ты свою работу рецензента делаешь спустя рукава, твои работы могут быть не приняты к публикации. С одной стороны, это много раз предлагалось кровожадной частью научного сообщества (никому не нравится получать пустую рецензию), с другой – непонятно, будет ли система полностью справедливой. Конечно, ещё интересно, сколько у авторов CVPR рецензии съест собака или испепелит робот на кухне. 🤤

В-третьих, запрещается подавать более 25 статей на конференцию. Тут нужно заметить, что принимается на CVPR примерно четверть поданных статей, так что самым плодовитым авторам (в 23 году у одного китайского профессора было 24 принятых статей) придётся начать выбирать, что подавать. Таким машинам для публикаций придётся либо мигрировать на других площадки, либо улучшать качество статей.

Остальные нововведения касаются запретов на использование языковых моделей для анализа статей (переписывать текст рецензии можно) и видимости имён рецензентов во время фазы дискуссии. Как думаете, все эти нововведения останутся и перекочуют в ML конференции?

Please open Telegram to view this post

VIEW IN TELEGRAM

5.6K views10:57

epsilon correct

Сколько на самом деле стоит инференс GPT-4o?

Почему-то многие думают, что провайдеры больших языковых моделей продают API чуть ли не себе в убыток. Я бы хотел поделиться прикидками о том, почему это совсем не так, и заодно помечтать о том, сколько параметров мы можем себе позволить тратить на модель, которая сможет заменить человека в работе.

Все расчёты можно воспроизвести в колабе, меняя цифры, как вам захочется. Выводы остаются неизменны.

Для расчётов нам нужно сделать несколько допущений:
1. Количество активированных параметров в модели. Для GPT 4 Turbo широко ходили слухи про 200 миллиардов параметров, так что 4o должна быть меньше. По данным Artificial Analysis, пропускная способность GPT-4o – 95 tok/s, что находится между LLama 3.1 7b (182 tok/s) и 70b (80 tok/s). Для наших целей предположим, что в 4o 100 миллиардов активированных параметров, делая скидку на то, что в OpenAI инференсом занимаются крайне толковые люди. Кстати, Gemini Flash 1.5 с последним обновлением выдаёт 330 tok/s.
2. Амортизированная стоимость сервера с 8 H100. Чтобы не сильно расстраиваться, возьмём оценку сверху как цену такого сервера на AWS – на сегодняшний день $39.33 в час. На рынке цены могут быть минимум в пять раз меньше.
3. MFU – какой процент вычислений используется эффективно. Стандартом является 30-50%, для наших прикидок возьмём 30%.

При таких допущениях (а с другими вы можете поиграть в колабе), стоимость инференса миллиона токенов получается $0.23. Сравним это с официальной ценой в $2.5 за input и $10 за output и получим наценку API в ~50 раз. И это – оценка сверху со всеми допущениями в сторону удорожания. С другой стороны, кому-то же надо скидываться Саме на Koenigsegg. 😮‍💨

Заодно мы можем посчитать, насколько дешевле модели в сравнении с кожаными мешками. Взяв минимальную зарплату в Нью-Йорке ($16) и производительность в 100 токенов в минуту (среднее у людей примерно 50 слов в минуту), получим стоимость миллиона токенов в $2666.67. Даже o1 со своими $60 / Mtok тут рядом не стоит. Есть, куда расти!

Please open Telegram to view this post

VIEW IN TELEGRAM

35.0K viewsedited 11:33

epsilon correct

Часто говорят, что PhD плохо влияет на психическое здоровье, а вот теперь подъехали данные: доля медикаментозного вмешательства существенно увеличивается к концу программы.

Берегите кукуху, дорогие подпичики, она стоит того. 🫂

Please open Telegram to view this post

VIEW IN TELEGRAM

18.4K views17:42

epsilon correct

Апдейт моделей Gemini 1.5 Pro & Flash

Вышла в свет очередная вещь, над которой я работал летом – обновление основных моделей Gemini. Из хайлайтов: +8% MMLU Pro, +23% 👽 на Hendrycks MATH, +10% на GPQA Diamond для Flash модели.

Цена на Gemini 1.5 Pro порезана больше чем в два раза. Также добавили Gemini 1.5 Flash 8B в Gemini API и Google AI studio.

Please open Telegram to view this post

VIEW IN TELEGRAM

28.2K viewsedited 16:38

epsilon correct

У EleutherAI вышел классный гайд по muP параметризации LLMок.

Для тех, кто не знает, muP – Maximal Update Parameterization – это серия статей, в которых Greg Yang (сейчас в xAI) развивает теорию параметризации глубоких сетей. Что-то вроде Neural Tangent Kernel или анализ сетей при помощи теории среднего поля, но с выводами более таргетированными на обучение сеточек градиентным спуском. Один из результатов – стабильная инциализация параметров сетей, которая позволяет избавиться от необходимости тюнить learning rate градиентного спуска.

В статье "Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer" с ребятами из OpenAI Грег выводит методы инициализации трансформеров. Нужно сказать, что, скорее всего, в индустрии не все инициализируют веса по muP, всё-таки теория и практика отличаются на практике. Тем не менее, с muP для каждой части нейросети мы можем (хотя бы в теории) сказать, корректно ли она пропускает через себя градиенты. Градиентные ~~энергетические~~ блоки – бич многих глубоких сеток, и дебажить такое – сплошная головная боль.

Сам Грег предлагает начинать знакомиться с теорией со статьи "A Spectral Condition for Feature Learning", к чему мы с уважаемыми подписчиками и приступим. 🤓

Please open Telegram to view this post

VIEW IN TELEGRAM

18.2K viewsedited 11:04

epsilon correct

Классы алгоритмической сложности для трансформеров Сначала расскажу про более объёмную статью, которую мы выпустили на этой неделе. Мы пытаемся дать теоретические оценки того, как эффективно трансформеры решают те или иные алгоритмические задачи. Алгоритмы…

Эту статью приняли на NeurIPS. Увидимся в Ванкувере! ✨

Также приняли ещё одну статью про бенчмарки GNN+LLM, о ней напишу как-нибудь позже.

Please open Telegram to view this post

VIEW IN TELEGRAM

7.9K viewsedited 13:01

epsilon correct

Очередной день, очередной кризис репликации в науке. Три недели назад я писал про дело Франчески Джино, теперь под подозрением Элизер Маслия – один из топовых учёных по исследованиям болезней Альцгеймера и Паркинсона. У него примерно 800 опубликованных статей, и до недавнего времени был главной подразделения нейронаук в National Institute of Aging.

Журнал Science опубликовал свою выжимку из полного досье – и там полная жесть. Проблемы в 132 👽 статьях, следы уже почти профессиональной манипуляции. Важен ещё и домен, в котором работал Маслия: налажать в лекарстве от Паркинсона – это вам не исследования честности, от фальсификаций в которых плохо будет разве что паре сотен MBA с маккинзоидами. Интересно, будут ли какие-то последствия ⛓, кроме увольнения – всё-таки от Альцгеймера умирает больше ста тысяч человек в год, а прогресс замедлился буквально на годы.

Рекомендую почитать оригинал статьи в Science: там сильно больше подробностей. Обидно, что такими темпами доверие к науке как институту подорвётся полностью.

Please open Telegram to view this post

VIEW IN TELEGRAM

12.4K viewsedited 11:05

epsilon correct

Последний раз я писал о себе чуть больше года назад. За последний год канал вырос больше, чем вдвое, я стал работать над совсем другими вещами, ну и вообще, пора закрепить новый пост.

Зовут меня всё ещё Антон. 👋 В 2021 я защитил PhD по машинному обучению в Германии, и с тех пор работаю исследователем в Google Research. Два года назад я перебрался в Нью-Йорк на постоянку, где теперь и обитаюсь. В гугле я устроился в команду, которая занимается алгоритмами на графах, оптимизацией, приватностью и рыночными механизмами. Вот тут можно прочитать пост с хайлайтами за 22 год.

Часть своего времени я работаю над графовыми нейросетями, эмбеддингами на огромных объёмах данных, и всякими около-графовыми штуками по мелочи. Публикую статьи и иногда внедряю нарисёрченное в прод. С этого года частично перекатился в LLMки и теперь занимаюсь данными для претрейна Gemini и Gemma, и парой более специализированных направлений, например, модельками, которые завоевали серебро на международной математической олимпиаде. Пока, вроде, получается неплохо.

Интересно, куда занесёт в следующем году. 🤔

Please open Telegram to view this post

VIEW IN TELEGRAM

8.1K views11:20

epsilon correct

Запустили Gemma 2 зафайнтьюненную на японский. Веса – на HuggingFace.

Заодно запустили соревнование на Кэггле на $150k 👀 на адаптацию Gemma к 73 разным языкам, включая русский и украинский. Ждём ваших сабмитов!

Please open Telegram to view this post

VIEW IN TELEGRAM

12.3K viewsedited 14:42

epsilon correct

Gemini 1.5 Flash 8B теперь доступна всем

После обновления 1.5 Flash мы выпустили Flash 8B для всех. Вдвое дешевле Gemini 1.5 Flash, по бенчмаркам – на уровне майской версии. Также подняли количество запросов в минуту до 4000. 😰

Стоит $0.0375/1M input, $0.15/1M output tokens. Цена примерно соответствует цене LLaMA 3.2 3B у together.ai, ну а по бенчмаркам она совершенно в другой категории. Мой ответ на вопрос “что вы делали этим летом”. 😛

Please open Telegram to view this post

VIEW IN TELEGRAM

8.3K viewsedited 18:26

epsilon correct

Почему графы?

В комментариях к новому интро задали понятный вопрос: как так сложилось, что я занимаюсь графами? Об этом я и сам частенько задумываюсь 🤪, так что пора и вам рассказать.

Для начала – немного истории: моё первое знакомство с около-рисёрчем по графам произошло на последнем курсе бакалавриата НИУ ВШЭ – мне хотелось повыпендриваться и написать наукоёмкую выпускную работу. Тогда был расцвет графовой кластеризации: люди придумывали быстрые алгоритмы оптимизации модульности, исследовали её пределы разрешающей способности, и писали на эту тему красиво свёрстанные стостраничные обзоры. Я набрёл на новую функцию, альтернативную модульности, с говорящим названием Surprise. Для неё тогда не было показано результатов жадного алгоритма (который для модульности называется алгоритмом Лёвена), вот его я придумал, заимплементировал, и чуток побенчмаркал. Хоть тогда он никому не приглянулся, начало было положено.

После вышки я пошёл в сколтех, где мне повезло работать с Panagiotis Karras, у которому тоже были интересны графы. Сначала мы пытались придумать что-то про influence maximization, но потом, ближе к концу магистратуры, я набрёл на тему графовых эмбеддингов – вот с этого момента всё и завертелось, потому что стало понятно, что их можно глубоко изучать в аспирантуре.

В изучении графов меня подкупает несколько аспектов. Во-первых, интуитивно простая модель данных: объяснить понятие графо можно за чашкой чая бабушке. При этом в области много интересных и глубоких результатов, связывающих графы с другими областями математики. Во-вторых, широкая применимость: если ты придумаешь хороший метод решения почти любой задачи на графах, шанс, что им воспользуются учёные в прикладной области, довольно велик. В-третьих, связанность с реальным железом: из-за неприспособленности компьютеров для работы с графами, для разных размеров задач можно придумывать новые алгоритмы, которые будут использовать, например, распределённые вычисления.

Почти на любые данные можно смотреть, как на граф, а иногда это даже бывает полезно. С другой стороны, любителям машинного обучения как область для вкатывания рекомендовать графы тоже не особо хочется. 😐

Please open Telegram to view this post

VIEW IN TELEGRAM

6.7K views11:10

epsilon correct

Please open Telegram to view this post

VIEW IN TELEGRAM

15.6K views11:15

epsilon correct

Не зря, получается, постил про нобелевки – заманил в офис одного известного в узких кругах физика

8.0K viewsedited 11:27

epsilon correct

Начинается сезон стажировок, а это значит, что мне пару раз на дню пишут всякие талантливые товарищи с вопросами, можно ли в нашу команду устроиться стажёром. Развёрнуто отвечать на весь поток писем не всегда получается, но с дорогими подпищеками поделиться мудростью всё-таки хочется. 👴

Стажёры для компаний – это в первую очередь источник дешёвого труда. Выхлоп от самих стажёрских проектов чаще всего минимальный, но зато у компании появляется (а) ценная информация про то, какова продуктивность потенциального фулл-тайм сотрудника и (б) вероятная возможность нанять его дешевле, чем среднего выпускника: при вероятном найме люди перестают активно собеседоваться с конкурентами, снижая цену.

До ковида, когда деньги были дешёвыми, технологические компании росли, как на дрожжах. Нанимали десятки тысяч человек в год, так что все привыкли к большому потоку студентов. С резким повышением ключевой ставки, деньги стали дороже, компании стали даже увольнять людей, а количество мест для стажёров значительно сократилось. Из того, что я вижу, студенты ещё не до конца прочувствовали новую экономическую реальность, и особо не стараются с подачами. А зря.

Если среди подписчиков есть студенты, пара быстрых советов: подавайтесь широко, но прицельно. Составьте список из 10-20 наиболее близких по темам, релевантным вашему PhD, и пишите им персонализирвоанные сообщения напрямую. На копипаст или, того хуже, сгенерированные сообщения отвечать сил уже нет. Всем удачи!

Please open Telegram to view this post

VIEW IN TELEGRAM

7.9K views11:02

epsilon correct

Пара мыслей про Долину

Направляясь в очередную командировку в наш головной офис, меня посетила мысль, что не все, в общем-то имеют представление о том, что такое эта наша Кремниевая долина. Среди подписчиков канала немало людей, у которых будет возможность там поработать, а мне бы хотело рассказать, почему, как мне кажется, стремиться туда смысла нет. Я там прожил около полугода в далёком 2019, так что, надеюсь, мнение будет не совсем голословным.

Сначала о хорошем: в Калифорнии в целом и в долине в частности офигенный климат. Количество комфортных солнечных дней в году зашкаливает, и это сильно влияет на настроение и самочувствие – всё-таки мы все немного цветочки-пирожочки. В паре часов – езды крышесносные национальные парки, любителям природы – полное раздолье. 🛌

Из плохого – полное отсутствие культурных событий и катастрофическая гомогенность общества. Нормальным вопросом при первой встрече может быть «ты программист или проджект?» – и у всех одни и те же интересы. Если вам нравятся исключительно люди, которые любят бег, хайкать и писать код – вопросов нет, милости прошу в долину. Остальным непрошенный совет: попробуйте выбраться хотя бы в Сан-Франциско, или, если совсем повезёт – в Нью-Йорк.

Please open Telegram to view this post

VIEW IN TELEGRAM

7.7K views14:03

epsilon correct

Запустили тут новую модельку Gemini-Exp-1114 в Google AI Studio. На арене #1 overall, math, hard prompts, creative writing. Кодинг всё ещё #3.

Без ответов по три минуты как o1, просто берёт и отвечает.

7.9K views20:20

2025/02/06 05:56:12
Back to Top

HTML Embed Code:

<iframe width="100%" src="https://www.group-telegram.com/buyppe/webview?embed=1" title="Channel Webview" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowfullscreen></iframe>