@nadlskom
что-то на DL-ском
Telegram channel @nadlskom: 5K subscribers, 2.1K views per post
No score yet
Fewer than 5 posts went out here in the last 30 days.
- 5K
- Subscribers
- 2.1K
- Median views over 30 days
- 42.3%
- Views / subscribers over 30 days
- 3
- Posts over 30 days
Data as of October 1, 2026
Personal blog of an AI interpretability and safety researcher writing about her work, conferences, and researcher life. As of 13 September: 4,987 subscribers — below the category median, posts come out less often than the category median, while engagement runs well above the category median with an ER of 57.8%. Over the past month the author covered the final symposium of MATS cohort 10 in London, shared highlights from a Q&A session with Neil Nanda covering questions about pursuing a PhD in AI, wrote about ICML 2026 with a roundup of her favorite conference papers, and published her own complexity-budget skill for Claude Code and Codex on GitHub. Other recurring topics include agent harnesses like Claude Code and Cursor, methods for spotting AI-generated text, and experiments with activation-based models.
catalog description About the channel, by its author
Авторка активно хочет зашарить все на свете и делится в этом канале. Связаться со мной @nadlsskom Тг буст канала: t.me/nadlskom?boost
Common questions
- How many subscribers?
- Subscribers: 5K. Median views per post: 2.1K. Views per subscriber: 42.3%. Measured on October 1, 2026.
- How often are posts published?
- Posts in the last 30 days: 3 — that is less than once a week. Measured on October 1, 2026.
- Does this channel have a Telegram tick?
- No Telegram tick.
- Who runs this channel page in the catalog?
- Nobody yet. If this is your channel, claim the page: you will be able to reply to reviews and see its stats.
Is this your channel?
Claim it — accurate metrics, replies to reviews as the channel, and an owner badge on the page.
Verify ownershipTakes a minute: a post with a code, or the bot as an admin
Your page on tg.place
Know the owner?
Forward them this message — they can verify their rights and collect what has piled up: page statistics and replies to reviews.
5,0154,982
Oct 15,015
Hover the chart or swipe it — we show the day.
Latest posts
Posts are in Russian — that is what the channel publishes.
- Привет, я работаю в METR. Занимаюсь самым трендовым ai safety. Дада, я на контракте в berkeley. Что, как мое имя? - Id 576dolboyeb2000
- Я обучил очень простой переводчик мозга мухи который позволяет ей управлять microduck, так что теперь можно дать мухе РОБОТИЗИРОВАННОЕ тело
huggingface.co/…
https://huggingface.co/spaces/AlexWortega/flywire-microduckx.com/…
https://x.com/justALEXWORTEGA/status/2099441563134758962?s=20 - Ладно, настоящая работа все же имеется🎀. И там мы на Хабре выложили мой блог постик про ICML 2026. Там я рассказываю зачем летать на конфы, если arXiv открывается и у вас дома. Также в нем собрала подборку статей, которые были моими фаворитами на конфе. И чтобы отрывками скучно не пересказывать, соединила в общий топик. Как от начала до конца научить агента быть лучше, чем опенсорс в 2026 и что с ним делать, когда он уже задеплоен в прод (как отслеживать safety и мониторить на предмет соблюдения исходных продуктовых целей) Заодно из новостей, что в этом году буду на обсуждении новостей в онлайн зале (с 12:00) на Practical ML Conf. Обсудим тенденции мира ML, и что сейчас на пике популярности с ребятами. Программу уже выложили, конфа 19 сентября, Москва + онлайн. Регайтесь
- Я переехала в Лондон снимаю квартиру за 504049483 тысяч долларов и я не нашла нормальную работу и все еще занимаюсь своим ресерчем. И сейчас вы можете писать комментарии иди ищи нормальную работу в корпе. Иди рабооотай. Но я очень надеялась, что у меня получится поднять 1000 цитат на своих статьях, которые я засылаю на каждый воркшоп, но цитаты так и не приходят. Мне пришлось снести их с гугл сколяра
- В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе) мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день. Есть ли возможность проверить все вызовы вручную? - нет. Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное. 🐱 Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки Red team строится так: Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар 💛модель ищет правдоподобное окно и добавляет минимум шагов 💛панель джаджей проверяет, что правка настоящая, минимальная и естественная 💛сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце). На постере замеры работоспособности 💅 P.S. было еще 2 крутые работы с симпозиума: Stealing Reasoning Traces from Proprietary LLM APIs Diffuse AI Control on Fuzzy Tasks
- Когда начальству пытались рассказать все нюансы использования, но это единственное, что он запомнил, чтобы запостить себе в твиттер
- Себастьян Рашка (видео) про то, как Claude маркирует сгенерированный текст. В свете моего интереса последний месяц к созданию скилла для написания текстов в человеческом стиле, меня заинтересовало. Про паттерны AI-текста и способы его распознавания
- 3.6KOpen in TelegramНа конференциях только и разговоров, что об агентах. Вообще, я бы назвал это harness'ами. Они могут приносить кучу пользы, и их огромное количество: Claude Code, Codex, pi, Hermes, OpenClaw, Cursor, Muse Code... Хорошая новость в том, что под капотом +- одни и те же механизимы, и если в них разобраться, почти не важно, какой harness у вас под рукой. Поэтому проведу в понедельник, 10 августа в 18:30 открытый вебинар «Агенты без магии». Разберём: * как правильно ставить задачи агенту * что такое скиллы, MCP и зачем они нужны * в чем разница с пайплайнами, и почему для повторяемых задач они лучше подходят (например, n8n) И с теорией, и с примерами. Свои подписки не требуются (но точно не будут лишними :) ) Участие, как и в предыдущий раз, свободное. Но нужно будет заполнить формочку (чтобы я знал, сколько вас будет). А если есть вопросы или кейсы, которые хочется разобрать – пишите в комментарии. А для тех, кто хочет глубоко погрузиться в ИИ и стать магистром AI ☕️ – у нас целая программа в МФТИ есть, с которой успешно выпустилось пять потоков. Онлайн, на английском, совместимо с работой, в небольшой группе. Подача документов через Госуслуги до 11 августа, вам достаточно оставить заявку, дальше мы проведем по шагам. Присоединяйтесь! P.s. Долго думал, какие аналогии провести, получилось вот такое: Claude Code – для храбрых Codex – для спокойных Goose – для желающих пропатчить KDE2 под FreeBSD Hermes –
для отакуpi – 🐭 - 2.9KOpen in TelegramMistral на столько frontier компания, что пока антропик и опенаи приостанавливает исследования моделей из-за опасности со стороны ии, а UK AISI утверждают, что Kimi вышла за границы sandbox, наши французские слоняры продолжают делать мощь💪💪💪💪🥖🥖
- все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает. Вот и я видел, но мне не нравилось что: - кастом модели надо учить с нуля - нельзя смотреть " а была ли модель байеснута при ответе" Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях. По сути это общее решение для задачи Activation oracle/white box monitoring Велком тыкатся:
huggingface.co/…
https://huggingface.co/spaces/AlexWortega/activation-oracle
The channel in numbers
- Created
- May 7, 2022
- Photos
- 425
- Videos
- 19
- Files
- 2
- Links
- 290
Telegram data as of October 1, 2026
Contacts
- Contact
- @nadlsskom
From the channel description
Reviews
Leave a review
No reviews yet. Yours would be the first.