@gonzo_ml
gonzo-обзоры ML статей
Telegram channel @gonzo_ml: 24.5K subscribers, 3K views per post, score 43
- 24.5K
- Subscribers
- 3K
- Median views over 30 days
- 12.3%
- Views / subscribers over 30 days
- 87
- Posts over 30 days
Data as of October 1, 2026
catalog description About the channel, by its author
Overview
Written automatically from the channel's data, updated 3 September 2026. The numbers in this text are as of that date; the fresh ones are in the tiles above.
@gonzo_ml is a channel that reviews recent machine learning papers — from the inner workings of optimizers and gauge symmetries to representation learning architectures. The write-ups are detailed, linking to arXiv, code repositories and outside reviews, occasionally drifting into physics books or science fiction references. It also mentions related projects from the same authors, such as a new channel dedicated to World Models.
With 90 posts over the last 30 days, the channel publishes far more often than the category median of 20 posts for Artificial Intelligence. The median post gets 2,581 views, and engagement sits at 10.6%, below the category median of 25.1%. Over the 18-day observation window, subscribers grew by 15 and average views rose by 386 — a modest but visible move.
This fits readers who want deep dives into specific papers, formulas and code rather than a news feed — a niche format for people already into the subject. With 24,332 subscribers and a Place Score of 32, the channel trails the category's subscriber median of 15,164 and its engagement median, but leads on posting frequency.
The owner hasn't verified this listing, and no ad pricing is published yet — reaching out happens directly on Telegram.
Common questions
- What is the @gonzo_ml channel about?
- The channel reviews machine learning research papers, covering topics from optimizers to representation learning, with links to arXiv and code. It occasionally touches on physics books and science fiction.
- Can I buy advertising on @gonzo_ml?
- The owner hasn't published ad pricing yet. You can reach out directly on Telegram to arrange a placement.
- How many subscribers?
- Subscribers: 24.5K. Median views per post: 3K. Views per subscriber: 12.3%. Measured on October 1, 2026.
- How often are posts published?
- Posts in the last 30 days: 87 — that is several times a day. Measured on October 1, 2026.
- Does this channel have a Telegram tick?
- No Telegram tick.
- Who runs this channel page in the catalog?
- Nobody yet. If this is your channel, claim the page: you will be able to reply to reviews and see its stats.
Is this your channel?
Claim it — accurate metrics, replies to reviews as the channel, and an owner badge on the page.
Verify ownershipTakes a minute: a post with a code, or the bot as an admin
Your page on tg.place
Know the owner?
Forward them this message — they can verify their rights and collect what has piled up: page statistics and replies to reviews.
Hover the chart or swipe it — we show the day.
| What it is made of | |
|---|---|
| Engagement | 6.7 of 30 |
| Growth quality | 16.7 of 20 |
| Reactions and forwards | 5.7 of 15 |
| Consistency | 3.6 of 12 |
| Trust | 3.9 of 8 |
| Reviews | not enough datano reviews yet |
Score 43 — from 5 of 6 signals: the rest are not measured yet. Methodology
Latest posts
Posts are in Russian — that is what the channel publishes.
Poll
- Снова про теорию генерализации и гроккинга. Много математики для желающих :) A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin Paper: arxiv.org/abs/2609.07755 Review:ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking). ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией. Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения. Подводить базу здесь: t.me/gonzo_ML_podcasts/4814
arxiviq.substack.com/…
https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization - Скажите вообще, насколько такой формат про Jev был полезен? Что хорошо, что плохо, что надо улучшить или сделать по-другому? Есть ещё какие-то темы, которые стоило бы прогнать так же?
- Вдогонку про Jev, вот чуваки начали собирать каталог применений и прочего:
github.com/…
https://github.com/AnotiaWang/awesome-jev - Про Darwin Gödel Machine писали, про Huxley-Gödel Machine писали, а про Red Queen Gödel Machine не писали! Исправляемся. The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane Paper: arxiv.org/abs/2606.26294 Review:Code: N/A Model: N/A ЧТО сделали: Предложили эволюционный фреймворк, в котором обучаемые эвалюаторы развиваются параллельно с целевыми агентами. Это позволяет обойтись без статичных бенчмарков при рекурсивном самосовершенствовании. ЧТО получили: Добавление эволюционирующего ревьюера подняло pass rate на бенчмарке Polyglot с 69.9% до 71.7% при снижении расхода токенов в 1.35–1.72 раза по сравнению с Huxley-Gödel Machine. При написании научных статей авторы получили долю одобрений 38.8%–40.5% (в 1.78–1.86 раза выше бейзлайна с его 21.8%) по оценке нескольких рецензентов. Точность проверки доказательств достигла 76% (+9% к бейзлайну) при трёхкратной экономии токенов. ПОЧЕМУ это важно: Совместная эволюция судей и генераторов формирует динамический curriculum и отсекает предвзятость моделей к собственным текстам без ручной поддержки бенчмарков. При этом теоретические гарантии поиска действуют только внутри отдельных эпох и опираются на неизменные якорные датасеты. Бегать вместе с королевой здесь: t.me/gonzo_ML_podcasts/4813
arxiviq.substack.com/…
https://arxiviq.substack.com/p/the-red-queen-godel-machine-co-evolving - Крутая команда авторов, включая фаундера Саканы Дэвида Ха, а также Себастиана Риси, выпустила книгу по нейроэволюции neuroevolutionbook.com
The channel in numbers
- Created
- February 21, 2019
- Photos
- 4K
- Videos
- 6
- Files
- 3
- Links
- 1.8K
Telegram data as of October 1, 2026
Reviews
Leave a review
No reviews yet. Yours would be the first.