@datastorieslanguages
Data, Stories and Languages
Telegram-канал @datastorieslanguages: 3,8 тыс. подписчиков, 1,3 тыс. просмотров на пост, оценка 57
57CВыше, чем у 5 из 10 каналов категории
Середина категории 46–63Этот канал 57
- 3,8 тыс.
- Подписчики
- 1,3 тыс.
- Медиана просмотров за 30 дней
- 34,7%
- Просмотры / подписчики за 30 дней
- 19
- Постов за 30 дней
Данные на 1 октября 2026 г.
Об искусственном интеллекте, языках и данных — для тех, кто следит за практикой машинного обучения, лингвистикой и инструментами на основе языковых моделей. Автор разбирает свежие работы: driving-модель Qwen-Drive на базе VLM, новую версию Claude с подешевевшим кэшем и снижением цены решения задач, обновление ChatGPT для генерации изображений и качество перевода с японского через GPT. Среди постов — рассказ об участии в соревновании Kaggle по геонавигации буровой скважины и пет-проект: читалка для многоязычных книг с подсказками по грамматике и словарям для десяти языков. На 13 сентября: у канала 3,7 тыс. подписчиков — меньше медианы категории. При этом ER держится на 39,1 %, заметно выше медианы категории в 23,2 %, а по числу постов за 30 дней канал на уровне соседей.
описание каталога О канале от автора
Канал о ML/AI, изучении иностранных языков, книгах и жизни. Контакт с автором t.me/Erlemar Персональный сайт: andlukyane.com Рекламу не публикую Забустить канал можно тут:
t.me/…
https://t.me/boost/datastorieslanguagesЧастые вопросы
- Сколько подписчиков?
- Подписчиков — 3,8 тыс. Медиана просмотров поста — 1,3 тыс. Просмотров на подписчика — 34,7%. Данные на 1 октября 2026 г.
- Как часто выходят посты?
- За 30 дней вышло постов: 19 — это почти каждый день. Данные на 1 октября 2026 г.
- Есть ли у канала галочка Telegram?
- Галочки Telegram нет.
- Кто ведёт страницу канала в каталоге?
- Пока никто. Если это ваш канал — заберите страницу: сможете отвечать на отзывы и видеть её статистику.
Это ваш канал?
Подтвердите владение — точные метрики и что улучшить, ответы на отзывы от лица канала и бейдж владельца на странице.
Подтвердить владениеЗаймёт минуту: пост с кодом или бот в администраторах
Ваша страница в tg.place
Знаете владельца?
Перешлите ему это сообщение — он подтвердит права и заберёт накопленное: статистику страницы и ответы на отзывы.
3 8133 575
1 окт.3 813+4 за день
Наведите на график или проведите пальцем — покажем день.
| Из чего складывается | |
|---|---|
| Вовлечённость | 13 из 30 |
| Качество роста | 13,3 из 20 |
| Реакции и пересылки | 6,9 из 15 |
| Регулярность | 11,4 из 12 |
| Доверие | 3,9 из 8 |
| Отзывы | недостаточно данныхотзывов пока нет |
Оценка 57 — по 5 показателям из 6: остальные пока не измерены. Методология
Последние посты
- NVIDIA Kumo TabularNVIDIA выпустила новую либу для табличных данных. Тренировали исключительно на синтетических данных. Уверяют, что модель лучше всех конкурентов на TabArena leaderboard. Правда на официальном лидерборде этой модели нет. Верим в успех? #datascience #ai
huggingface.co/…
https://huggingface.co/blog/nvidia/kumo-tabular - Kaggle: я свободен! Разбанили! И я был ни в чём не виновен :) "After reviewing the information and other materials submitted in your appeal, we have decided to reverse our prior decision, and have taken action to reinstate your content and/or account on our platform. This restriction was in response to recent unauthorized activity on your account, which was a result of unauthorized third-party access rather than deliberate policy violations on your part." #kaggle
- Меня тут это... на Kaggle забанили говорят, что за автоматизацию Единственная причина о которой я подозреваю - клод засабмитил ноутбук на тпу и проверял его статус раз в час или раз в полчаса Подал appeal, жду #kaggle
- 1,4 тыс.Открыть в Telegram🌸AI Research Preference Model🌸 #nlp #про_nlp #nlp_papers Сегодня опять про скаффолды для агентов. Мы уже говорили про то, хорошая ли идея применить сверху preference models для оценки потенциала идей (спойлер: ). А что, если попробовать обучить такую preference-модель не на вкусовщине (новизна идеи, "вкус", интуиция и т.д.), а на верифицируемом сигнале? Про это наша новая статья — “AI Research Preference Models”. 🌸TL;DR Главная проблема: AI-агент может быстро придумать множество вариантов эксперимента, но полноценный запуск каждого варианта — обучение модели и оценка результата — требует часов работы GPU. Поэтому критически важно заранее понять, какие идеи действительно стоит проверять. Мы предлагаем Research Preference Model (RPM) — модель, которая сравнивает несколько предложенных решений и выбирает наиболее перспективное до их полного запуска. В идеале, такая модель может выучить паттерны лучших практик МЛ, чтобы использовать эту информацию для попарного сравнения экспериментов, какой будет более перспективным. Рассматриваются два варианта: Inference-only RPM анализирует планы, код и результаты предыдущих экспериментов только при помощи рассуждений LLM. Agentic RPM дополнительно проводит дешёвые пилотные эксперименты: запускает сокращённое обучение (5 минут, 30 минут, 4 часа), проверяет код и использует полученные метрики для выбора. 🌸Агент RPM встроена в исследовательского агента AIRA-dojo. На каждом шаге агент генерирует 15 вариантов продолжения, после чего RPM проводит попарное сравнение и отправляет на полноценный запуск только победителя. 🌸Данные Эксперименты проведены на 20 задачах AIRS-Bench, охватывающих языковое моделирование, математику, биоинформатику и временные ряды. Каждому запуску предоставлялись 24 часа на одной H200 GPU. 🌸Основные результаты обычный AIRA-dojo: 0,684 среднего нормализованного балла; с Inference-only RPM: 0,711; с Agentic RPM: 0,729; теоретически достижимый результат: 0,748. Обе RPM достигают результата обычного 24-часового агента примерно за 15 часов, то есть требуют примерно в 1,5 раза меньше вычислений. Кроме того, были получены новые SOTA: 94,1% на WinoGrande против прежнего агентного SOTA 90,4%; 95,7% на SVAMP против опубликованного человеческого SOTA 94,2%. 🌸Главный вывод статьи: прогресс исследовательских агентов зависит не только от способности генерировать хорошие идеи, но и от умения выбирать, какие идеи заслуживают дорогой экспериментальной проверки. Дополнительные вычисления выгодно тратить не только на генерацию решений, но и на их предварительный отбор, основанный на предсказуемых и верифицируемых сигналах. Сигнала от мини-версии эксперимента, с первых 5 минут, бывает вполне достаточно! Проверено на одном скаффолде, но для всех tree-search подходов такой апгрейд должен сработать. 🟣Arxiv arxiv.org/abs/2608.13940 🟣Alpharxiv alphaxiv.org/abs/2608.13940
- DeepSeek-V4.1-Flash: Frontier Agents on a Smaller Memory Budget Большая часть недавнего прогресса в LLM — это reasoning, масштабные RL-rollouts и всё более изощрённое обучение агентов. Но одним из bottlenecks остаётся контекст. Coding agents, research agents и tool-using системы раз за разом обрабатывают сотни тысяч токенов входа, генерируя при этом сравнительно мало выхода. На таком workload prefill-компьют и KV cache становятся главной инфраструктурной проблемой. DeepSeek-V4.1-Flash — это, по сути, попытка перепроектировать Transformer вокруг этого сценария. 552B MoE backbone, 1M контекст, нативное зрение, 45T мультимодальных токенов на претрейне. Работают три механизма: - Causal Encoder-Decoder (CED): 40 слоёв делятся на 20-слойный causal encoder и 20-слойный decoder. Каждый decoder-слой проецирует свой global KV не из собственных hidden states, а из финального hidden state энкодера, поэтому декодер можно пропустить на prefill. Отсюда асимметрия: около 8B активных параметров на токен в prefill против 16B в decode. - Compressed Sparse Attention 2 (CSA2): каждый слой статически получает один из трёх режимов — Full, Reindex или Reuse. Sharing KV экономит память, sharing Top-K-индексов ещё и убирает повторное скорингование всей истории. В итоге один decoder-слой создаёт main KV, который читают все двадцать, а вместе с FP4-квантованием это ужимает global cache до 890 байт на токен, примерно четверть от DeepSeek-V4-Flash. - SWA Bounded Replay: sliding-window KV вообще не персистится между ходами, а на cache hit восстанавливается проигрыванием одного окна токенов вместо честной реконструкции по всем слоям. Реконструкция неточная, но авторы оценивают потерю качества как незначительную. На post-training практически весь прирост идёт из масштабирования синтезированных задач и агентных окружений. Отдельно любопытен раздел про RL failure modes: агенты занимаются reward hacking, эксплуатируют реальные уязвимости в песочницах, удаляют системные бинарники, а иногда сносят файловую систему целиком. Paper Model Мои обзоры: Блог Medium #paperreview
- Data & AI London Meetup22 сентября в Лондоне буду делать доклад: буду снова рассказывать про "AI-driven participation in Kaggle competitions, на этот раз добавлю опыт из соревнования ROGII. Помимо этого будет ещё два доклада: Javier Ramirez: When Your Wire Protocol Becomes the Bottleneck Alexy Golev: When the Bug Looks Like Success: Reliability Patterns for Multi-Agent AI Systems #datascience #career
meetup.com/…
https://www.meetup.com/data-ai-london/events/316165116/ - GDE Swag Недавно я рассказывал как я пробовал Antigravity в рамках программы Google Developer Expert. Потом я ещё участвовал в peer review других проектов: в целом было неплохо, откровенно плохих проектов было мало и несколько было прям интересными. А ещё мне за это пришёл прикольный swag :) #ai #career
- Рекомендую канал Хочу порекомендовать вам интересный канал о регулировании систем ИИ по всему миру: ИИ & Право. Новые законы, судебные кейсы, международные инициативы, статьи об ИИ-комплаенсе и управлении рисками ИИ, вопросы этики и правовые казусы - все это со ссылками на первоисточники и документы, которые авторы канала ищут специально для вас. Присоединяйтесь к ИИ & Право, чтобы не отстать от быстроразвивающейся новой отрасли. Канал доступен также и на английском языке. Весьма актуально, учитывая как Dario недавно заявил о том, что надо замедлять разработку frontier AI.
- 9 реакцийОткрыть в Telegram
Медиа
О канале в цифрах
- Создан
- 9 июня 2022 г.
- Фото
- 102
- Видео
- 13
- Ссылки
- 636
По данным Telegram на 1 октября 2026 г.
Рейтинги и подборки
Контакты
- Связь
- @Erlemar
Из описания канала
Отзывы
Оставить отзыв
Отзывов пока нет. Ваш будет первым.