@ai_productВ избранном у 1
AI Product | Igor Akimov
Telegram-канал @ai_product: 8,3 тыс. подписчиков, 2,6 тыс. просмотров на пост, оценка 57
- 8,3 тыс.
- Подписчики
- 2,6 тыс.
- Медиана просмотров за 30 дней
- 31,7%
- Просмотры / подписчики за 30 дней
- 35
- Постов за 30 дней
Данные на 1 октября 2026 г.
описание каталога О канале от автора
Обзор
Составлен автоматически по данным канала, обновлён 6 сентября 2026. Числа в тексте — на эту дату; свежие стоят плитками выше.
AI Product | Igor Akimov — канал о новостях искусственного интеллекта: релизы моделей от OpenAI, Anthropic, Google и китайских лабораторий, разборы бенчмарков, чипов и промпт-инженерии. Автор пишет от первого лица, с личными оценками и сравнением цифр разных моделей между собой.
Канал публикует часто: 33 поста за 30 дней при медиане по категории «Искусственный интеллект» в 20 постов — почти вдвое активнее типичного канала ниши. При этом ER держится на уровне 29,9%, что выше медианы категории (28,0%). На 8 125 подписчиков медиана просмотров поста — 2 433. За 13 дней наблюдений подписчиков прибавилось 77, а средние просмотры выросли на 223.
Place Score канала — 61, при 71 записи в категории. По размеру аудитории канал заметно уступает медиане категории (14 145 подписчиков), но берёт частотой публикаций и вовлечённостью.
Подойдёт тем, кто хочет держать руку на пульсе релизов моделей и следить за новостями AI-индустрии без задержек — автор публикует материал почти ежедневно и разбирает конкретные цифры бенчмарков.
Частые вопросы
- О чём канал @ai_product?
- Канал пишет о новостях искусственного интеллекта: релизы моделей OpenAI, Anthropic, Google, разборы бенчмарков и чипов. Автор комментирует новости от первого лица с личными оценками.
- Можно ли купить рекламу в @ai_product?
- Владелец канала пока не открыл прайс на рекламу. Связаться с ним можно напрямую в Telegram.
- Сколько подписчиков?
- Подписчиков — 8,3 тыс. Медиана просмотров поста — 2,6 тыс. Просмотров на подписчика — 31,7%. Данные на 1 октября 2026 г.
- Как часто выходят посты?
- За 30 дней вышло постов: 35 — это почти каждый день. Данные на 1 октября 2026 г.
- Есть ли у канала галочка Telegram?
- Галочки Telegram нет.
- Кто ведёт страницу канала в каталоге?
- Пока никто. Если это ваш канал — заберите страницу: сможете отвечать на отзывы и видеть её статистику.
Это ваш канал?
Подтвердите владение — точные метрики и что улучшить, ответы на отзывы от лица канала и бейдж владельца на странице.
Подтвердить владениеЗаймёт минуту: пост с кодом или бот в администраторах
Ваша страница в tg.place
Знаете владельца?
Перешлите ему это сообщение — он подтвердит права и заберёт накопленное: статистику страницы и ответы на отзывы.
Наведите на график или проведите пальцем — покажем день.
| Из чего складывается | |
|---|---|
| Вовлечённость | 11,9 из 30 |
| Качество роста | 16,7 из 20 |
| Реакции и пересылки | 6,9 из 15 |
| Регулярность | 9 из 12 |
| Доверие | 3,8 из 8 |
| Отзывы | недостаточно данныхотзывов пока нет |
Оценка 57 — по 5 показателям из 6: остальные пока не измерены. Методология
Последние посты
- Бенчмарки железа для ИИ-шек Artificial Analysis сделал AA-AgentPerf-Local – открытый бенчмарк, который прогоняет записанные сессии реальных агентов: 8 задач, 168 ходов модели, контекст разрастается до ~56K токенов. Каждый ход генерирует ровно столько токенов, сколько в записи, так что все железки делают одинаковую работу. Можно запустить у себя против любого OpenAI-совместимого сервера. Что тестировали: – Железо: DGX Spark (128 GB), AMD Ryzen AI Halo (128 GB), MacBook Pro M5 Pro (64 GB), RTX 5090 (32 GB) – Модели: Qwen3.5-9B, Qwen3.8-27B, Qwen3.6-35B-A3B, Ling 3.0 Flash (124B / 5B активных), всё в 4 битах – Все 14 конфигов одинаково настроенные. Результаты: – RTX 5090 рвёт всех, если модель влезает в 32 GB – быстрее остальных в 3.5+ раза. Причина простая: 1,792 GB/s пропускной способности памяти против 256–307 GB/s у систем с unified memory. Но посмотрим, что будет на Mac Studio. – Скорость больше всего зависит от активных параметров: MoE Qwen3.6-35B-A3B самая быстрая везде, в 2.5–3.3 раза быстрее плотной 27B – DGX Spark и Ryzen AI Halo стоят одинаково ($4,000 MSRP), память почти одинаковая, но Spark быстрее в 1.4–1.7 раза на трёх моделях из четырёх. Больше вычислений на префилл + зрелый CUDA – MacBook Pro M5 Pro – единственный ноутбук, и он в пределах 2–9% от Halo на двух моделях, при этом сейчас самый дешёвый из четвёрки ($3,700) – Спекулятивное декодирование даёт +30–120% к скорости декода 27B сверх теоретического потолка по памяти Прикол, что даже когда 73–93% промпта берётся из кэша, новые токены съедают 22–41% всего времени. Агент ведь постоянно читает результаты тулов – за сессию ~196K новых входных токенов против ~31K выходных. Когда тул возвращает большой файл, Halo думает до 24 секунд, MacBook – до 39, а 5090 – около 2. Короче, для локальных агентов смотреть надо не только на скорость генерации, но и на скорость чтения контекста – именно там unified memory сейчас проседает. Если модель влезает в 32 GB – брать 5090 и не мучиться, если нужны большие MoE – Spark. А мак норм как компромисс, если он и так уже на столе :)
artificialanalysis.ai/…
https://artificialanalysis.ai/articles/aa-agentperf-local - Новинки с OpenAI DevDay Пока кратенько, надо детальнее изучать – Dots – постоянно работающие агенты, которые изучают, что вам важно, и сами берут задачи. Типа могут баги разгребать или на почту отвечать. Пока в Pro и Business Premium, для Enterprise – бета, выключенная по умолчанию – GPT-6.1 Sol – почти уровень Astra, но в 5 раз дешевле по токенам. Сильный апгрейд в агентном кодинге и computer use. Уже доступно. – Ultrafast – премиальный тариф скорости: до 8x в Codex (300 токенов/сек) и до 6x в API. Пока только для GPT-6 Astra. – Pro 500 – новый тариф с лимитом в 25 раз больше Plus и доступом к Ultrafast за 500 баксов. – Agents API с computer use – плюс мультиагентность из Codex, tool search и сжатие контекста. Инфраструктуру держит OpenAI. Параллельно с Amazon сделали Bedrock Managed Agents – те же агенты OpenAI, но целиком внутри AWS – Decisions API – модель отвечает на заранее заданные вопросы с фиксированными вариантами ответа. Классификация, роутинг, выбор следующего шага агента. Агааа! Говорил я скоро Jev скопируют! – Codex – облачный запуск с любого устройства, голосовое управление в CLI, ревью кода в десктопе и Codex Security Cloud, который сканирует репозитории и готовит фиксы, пока ноут закрыт. Скоро за вас и задачи ставить будет. – Плагины – ChatGPT открывает свою внутреннюю платформу: панели в сайдбаре, просмотрщики файлов, автоматизации через MCP Events. Очередной маркетплейс:-/ – Офис – Space для команд, Pages как совместные документы людей и агентов, совместные слайды с экспортом в PowerPoint/Google Slides, @ChatGPT в Slack и Teams, плагин для записи встреч. Это прям супер-жесткий наезд на все типичные рабочие инструменты сразу, от таск-менеджеров до мессенджеров. – Sign in with ChatGPT – подписка работает как кошелёк у 16 партнёров (Devin, Notion, Vercel и др.), с лимитами на каждого. Полезненько. По сути подписки на других в подарок. – Marketplace – энтерпрайз может тратить уже законтрактованный бюджет OpenAI на софт 32 партнёров: Adobe, Figma, Salesforce, Harvey, CrowdStrike и т.д. Тоже типичный вариант привязать к себе финансовые потоки. Прикол, что Notion одновременно партнёр в Sign in with ChatGPT – и прямой конкурент Pages и Space :) Короче, у ChatGPT 1.2 млрд пользователей в неделю, и OpenAI явно хочет, чтобы там же происходила вся работа – документы, встречи, код, агенты, подписки. Для разработчиков самое практичное – Sol за 1/5 цены Astra и computer use в Agents API, ну и Decisions.
openai.com/…
https://openai.com/index/devday-2026-recap/ - Опа, Sonnet 5.5 – почти Opus за полцены Anthropic выкатили вторую модель семейства 5.5. Та же цена, что у Sonnet 5, но быстрее на 30%+ и до 30% дешевле за задачу, потому что жрёт заметно меньше токенов. Что внутри: – Цена $2 / $10 за млн токенов (вход/выход), кэш $0.20. Opus 5.5 – ровно вдвое дороже: $4 / $20 – Позиционируют как рабочую лошадку для понятных задач: баги, документы, слайды, таблицы. Opus 5.5 остаётся для сложной работы, где нужно суждение – Haiku 5.5 обещают в ближайшие недели Бенчмарки: – Terminal-Bench 4.0: 70.6% против 10.3% у Sonnet 5. И да, это выше Opus 5.5 (66.4%) – GDPval-AA (реальная офисная работа по 44 профессиям): 1844 против 1846 у Opus – разница на уровне погрешности – CursorBench: 55.5%, отстаёт от Opus на пару пунктов – OSWorld (computer use): 80.1% против 81.8% у Opus – Первый Sonnet, который прошёл Pokémon Red, глядя только на скриншоты :) Прикол, что главная история тут не в качестве, а в экономике. На ряде бенчей Sonnet 5.5 на Low/Medium effort обгоняет лучший результат Sonnet 5 примерно за десятую часть стоимости задачи. У Balyasny на финансовых задачах – 121k токенов на ответ против 497k. У Base44 приложения собираются за 3.6 итерации вместо 7.7 у Opus 5. Из нового по безопасности – первый Sonnet с кибер-фильтрами уровня Opus: на рискованных security-запросах он будет откатываться на Sonnet 5. Плюс классификаторы против дистилляции – вытаскивать reasoning через фейковые аккаунты станет сложнее. Для тех, кто на API: если гоняете Sonnet с выключенным thinking, перед миграцией надо переключиться на новую настройку between_tools. Короче, для большинства продакшн-сценариев Opus теперь нужен реже – архитектуру и сложные решения ему, а реализацию и объёмную рутину можно спокойно отдавать Sonnet 5.5. Кто уже пересчитал свои юнит-экономики? )
anthropic.com/…
https://www.anthropic.com/claude-sonnet-5-5 - 1,8 тыс.Открыть в TelegramО, Gemini Live решил пожрать конкурентов с Аватарами Через неделю после выхода Gemini 3.8 Live Google добавил к нему Live Avatar – говорящую голову, которая генерируется почти в реальном времени и синхронизирована с речью модели. То есть встал на поляну HeyGen, D-ID, Synthesia. Что внутри: – липсинк, мимика и нормальный turn-taking, то есть его можно перебивать – асинхронный tool calling: пока аватар болтает с клиентом, в фоне дёргает API. В демо он так регистрирует гостя в отеле и не зависает на паузе «секундочку, проверяю» – 97 языков, переключение прямо посреди разговора, и по словам Google липсинк при этом не разваливается и картинка не «плывёт» – есть библиотека готовых аватаров, а свой можно сделать из одного качественного фото, но пока только через allowlist – всё помечено водяным знаком SynthID, и в аудио, и в видео Доступно только в Gemini Enterprise (Agent Platform, бывший Vertex), для обычных пользователей пока ничего. Решили пока не заморачиваться с регулированием и авторскими правами на голоса. Прикол, что в документации первым use case идут «корпоративные амбассадоры», сгенерированные из внешности сотрудников или нанятых актёров. То есть Google сразу закладывает юридическую рамку: оцифровать своего лучшего менеджера по продажам можно, но только с бумажкой. Дальше в списке идут NPC в играх, навигаторы по больницам, умные очки и авто. Короче, связка «голос + лицо + инструменты» наконец собрана в одном API, а не склеена из трёх вендоров со своей задержкой на каждом шаге. Для ресепшенов, банковских отделений и киосков в ТЦ это прям норм. Вопрос, как всегда, в цене минуты видео и в том, не станет ли клиентам жутковато через пару минут разговора. Цены пока нет. Скорее всего будет не сильно дешево, но дешевле конкурентов. Ждем релиза на всех.
blog.google/…
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-with-live-avatar/ - ElevenLabs смотрел-смотрел, как обходят конкуренты, и выкатил Eleven v4 Сразу в топ Artificial Analysis Новая архитектура – модель читает сценарий «как актёр озвучки»: понимает, кто говорит, что только что произошло и с какой интонацией подать реплику. Языков стало 90+ (у v3 было 70+). Бенчмарки Artificial Analysis: – Provider Voice Arena – #1 с Elo 1319, лучше Cartesia Sonic 3.6 (1276) и Gemini 3.8 Flash TTS (1267). Первое место во всех четырёх категориях: саппорт, ассистенты, обучение, развлечения. Если что это все английский, остальные языки самим тестировать надо. – Controlled Voice (все модели говорят одним и тем же кастомным голосом) – #2 с 1157, уступает только Qwen-Audio-3.1-TTS-Plus от Alibaba. Короче, голоса у elevenlabs лучше, а вот стандартный голос может чуть уступать. – Pronunciation Robustness – 91.7%, лучший результат, который AA вообще намеряли. Gemini 3.8 Flash TTS – 89.5%, v3 – 85.6% – скорость – 73.4 символа в секунду против 42.5 у v3. Что внутри: – теги вроде [laughs], [whispers], [door slams] прямо в тексте, v4 слушается их лучше, чем v3 – context stitching – длинный текст (хоть аудиокнига) без швов по темпу и подаче – перегенерация фразы хоть 50 раз – голос не «плывёт» – вернули Professional Voice Clone, которого не было в v3 v4 Turbo – для реалтайма и агентов: ~150 мс до первого звука (у Sonic 3.6 – 262 мс, у GPT-4o mini TTS – 814 мс, но это замеры самих ElevenLabs) и двунаправленный стриминг – звук идёт ещё до того, как LLM допишет предложение. Но если что конкуренты быстрее. 75-150 мс дают основные топовые модельки. А теперь про деньги: $80 за 1M символов. Дешевле, чем 3 версия. Sonic 3.6 – $49, Gemini 3.8 Flash TTS – $16.49. То есть Google в 5 раз дешевле и отстаёт всего на 52 пункта Elo. Inworld в 4 раза дешевле, Grok, Soniox - еще дешевле. Короче, по качеству и произношению – топ, для аудиокниг и брендового голоса норм. Рекламы всякой, озвучки фильмов. А вот для колл-центра на миллионы минут я бы сначала посчитал юнит-экономику на Gemini, InWorld, Grok, Cartesia – разница в 5-10 раз по цене быстро съедает разницу в качестве. elevenlabs.io/v4
- Ну вот, подходящий конкурент Jev - GLiNER-2.5 Как уже писал выше их NER в GLiNER-2 я выбрал из десятка моделей для поиска и вычищения персональных данных. Это скорее 100% конкурент JEV, более под операционную часть. Передаешь текст и набор меток прямо в вызове – получаешь ответ. Без промпта, без генерации токенов, один проход. Если по кейсам, то можно прикинуть, что это например: – интент клиента (возврат, отмена подписки, проблема со входом) – роутинг тикетов и писем по отделам – сентимент, включая «mixed», и аспекты отзыва (батарея плохая, экран отличный) – срочность, severity инцидентов, спам, модерация – «нужно ли звать человека» и даже «закончил ли агент задачу» – несколько решений за один вызов: интент + приоритет + нужен ли человек + темы Можно дать метки с описаниями, если название само по себе неоднозначное, и шкалы типа 0–10 для оценок. Бенчмарки (свой датасет fast-decisions, 17 доменов, exact match): – GLiNER2.5-Decide 340M – 60.2% – GLiNER2.5-Decide 1B – 59.6% – Jev – 57.6% – мультиязычная версия 287M – 56.7% - Laya 46.6% То есть обходит без проблем расхайпленный JEV, при этом работает на CPU, лицензия Apache 2.0, можно поставить на любую табуретку у себя. Короче, это уже можно в продакшене у себя использовать. Поставить перед LLM: первичная сортировка входящего потока, быстрое принятие решений, извлечение информации, заполнение метаданных, фильтрация. Гонять коммерческую модель еще и с задержкой до провайдера по интернету будет явно дороже и дольше.
huggingface.co/…
https://huggingface.co/fastino/GLiNER2.5-Decide - В блогосфере только и разговоров, что о Jev. Который в 193 раза быстрее и в 444 раза дешевле о_О Было легкое ощущение всеобщего помутнения, когда полились статьи про «нереальный прорыв» и «уделали Альтмана». Кейсы там такие, что я до сих пор ржу. GPT-6 Astra на high reasoning текстом спрашивают, есть ли в документе персональные данные и почему. Она секунд 6 почти посимвольно собирает ответ «Да, есть фамилия и имя, потому что указано, кто совершал операцию». А Jev достает правильный ответ из волшебного мешочка за 100 мс. Ээээ... Такие задачи решаются JSON-ом с ответом в начале, а не простыней текста, которую потом еще парсить. И уж точно не флагманом с размышлениями – Gemini 3.8 Flash или GPT Luna сделают то же самое на порядок дешевле и быстрее. Так о чем речь. Это нейросетка, у которой обрезан текстовый вывод. Подаете текст и варианты ответа (до 255), на выходе – вероятности. Вход стоит копье, выход бесплатно, ответ за доли секунды. Посмотрел тесты, сделал свои прогоны на классификаторе документов и категоризации отзывов. Штука прикольная, но очень специализированная. Что хорошо: – нормальный реранкинг за копейки (на Хабре в тесте на справочнике ОКТРУ обошел даже флагманы) – хорошо решает задачи с небольшим количеством классов: спам/не спам, тональность, тема, запрещенка – почти не дрифтит от перезапусков, сильно стабильнее LLM – уверенность хорошо отделяет очевидное от серой зоны, так что сложное можно отдать умной модели и срезать расходы раза в 3–4 Что не очень: – на тонкой классификации типа Banking77 – 81% против 84.4% у Opus 5, и на таких задачах лучшая LLM везде была выше – на русском местами проседает (на XNLI минус 11 п.п.), и калибровка плывет сильнее – надо нормально промптить или расписывать каскад узких вопросов, иначе работает хуже дешманских моделей – если есть 2000+ размеченных примеров, дообученный маленький энкодер обходит Jev со свистом: 88.8% против 77.8% На моих тестах в сравнении с Луной и Gemini 3.8 flash вышло в 2–3 раза быстрее и в 2–3 раза дешевле, а не в 100. Качество – примерно 85% от эталона. Ну-у... такое. Плюс это еще один вендор: хостится только в США, у больших облаков его пока нет. Попробуйте объяснить это энтерпрайз-клиентам. И вы серьезно будете отправлять персональные данные на сторону, чтобы проверить, персональные ли это данные? Даже за копейки и миллисекунды? Не проще поставить GLiNER2 на свой сервер и проверять все локально за те же доли секунды? Короче, это не убийца LLM, а очень быстрый и дешевый zero-shot классификатор уровня средних моделей. Как первый фильтр перед LLM, для роутинга, реранка и guardrails – норм. Но пороги и калибровку надо делать на своих данных, особенно для русского: вероятностям «из коробки» верить нельзя. И я на 100% уверен, что топ-лаборатории скопируют такое через месяц-два. Ребята круто прокачали генерацию данных для обучения, но с большими деньгами и ГПУшками это повторяется быстро.
typesafe.ai/…
https://typesafe.ai/blog/introducing-system-one-models-and-jev - Google выкатил Gemini 3.8 TTS. Видимо все силы кинул в голос ) Моделей две: – Gemini 3.8 Flash TTS: для творческой работы, чтобы задать характер персонажа и сыграть сцену – Gemini 3.8 Flash-Lite TTS: для больших объёмов, когда важна цена Что умеют: – Голос генерируется по текстовому описанию, больше 100 языков и диалектов – Больше 2000 готовых голосов с региональными вариантами: мексиканский испанский, квебекский французский, шотландский английский – Клонирование голоса по 30-секундному сэмплу, с проверкой согласия и водяным знаком SynthID – Режиссура по строкам: в сценарии пишешь ремарки обычным языком, и модель их отыгрывает – Держат голос стабильным на часах аудио – Нативный диалог двух спикеров – Смех, вздохи, «ага», «угу», перебивания: всё, что раньше выдавало робота – Скоро обещают ремикс голоса: тембр, высота, темп, акцент По бенчмаркам: – Hume AI Voice Design: первое место (71.4), по акцентам тоже первое (60.8) – Hume AI Overall Quality: первое и второе места у Flash и Flash-Lite – Voice Arena: топ по японскому, бразильскому португальскому, вьетнамскому, арабскому, мексиканскому испанскому и хинди Доступно уже сегодня Видос: youtu.be/FL6mI_Br-mc Есть и ложка дёгтя: клонирование голоса не работает в ЕС, Великобритании, Швейцарии, Индии, Иллинойсе и Техасе.
blog.google/…
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/ - Opus 5.5 vs GPT-6 Sol и Luna – в один день! Сегодня прям дуэль. Anthropic выкатила Claude Opus 5.5, OpenAI – GPT-6 Sol и Luna, облегчённые версии Astra. И обе продают одно и то же: почти флагман, но дешевле. Opus 5.5: – $4 / $20 вместо $5 / $25, кэш $0.20 вместо $0.50 – Artificial Analysis Index – 58, первое место. У Astra и Fable 5.1 по 53, для топа отрыв в 5 пунктов – это прям много – Terminal-Bench 4.0 – 66.4% против 57.9% у Astra и 55.8% у Fable 5.1 – GDPval-AA – 1846 Elo, у Astra – 1542 – обещают починить «клодовский» стиль: главное в начале, меньше воды. Посмотрим :) GPT-6 Sol и Luna: – Sol – $2 / $10 (ровно как Sonnet 5). Вдвое дешевле GPT-5.6, контекст 1.05M. Luna – $0.10 / $0.50. Вообще какое-то копье, дешевле многих китайцев теперь. – AA Index: Sol – 48, Luna – 37. Старый GPT-5.6 Sol – 47 – DeepSWE: Sol – 68.8% за $2.74 на задачу, Luna – 66.6% за $0.22. Разница 2 пункта, а цена в 12 раз ниже – AutomationBench: Sol – 33.2% за $0.27 на задачу. Для сравнения Opus 5.5 – 40%, Astra – 41.4% за $1.73 У Anthropic есть подвох: токен подешевел на 20%, а думать модель стала больше. На индексе AA – 119K токенов на задачу против 73K у Opus 5 и 31K у Sol. CodeRabbit на код-ревью намерил +40–60% токенов. И thinking теперь вообще не выключается. Честно сравнить сложно – каждый показывает свои бенчмарки, OSWorld у них вообще разный. На общем стенде AA Opus 5.5 на medium против Sol на max: кодинг 52.5% vs 43.9%, документы +159 Elo у Opus, бизнес-процессы вничью. Задача – $1.34 против $1.06. Короче, Opus 5.5 сейчас самая умная модель, и в 2.5 раза дешевле Fable – кодинг и документы теперь туда. Luna – вот это прям новость для всех, кто гоняет классификацию и извлечение на потоке: в 10 раз дешевле Haiku. А Sol – такой середнячок по цене Sonnet, гонять для массовых задач. Ну и Sonnet 5.5, говорят, через пару недель. anthropic.com/claude-opus-5-5
openai.com/…
https://openai.com/index/introducing-gpt-6-sol-and-luna/ - Grok 4.7: фронтир по цене Grok 4.6 SpaceXAI наконец выкатили Grok 4.7 – после трёх переносов. Цена не изменилась: – $2 / $6 за млн токенов – как у 4.6. Для сравнения: GPT-5.6 Sol – $4 / $20, Fable 5.1 – $10 / $50 – есть fast-вариант: вдвое быстрее, вдвое дороже – доступна сразу в Cursor, Grok Build, API и у роутеров Бенчмарки (xHigh): – CursorBench 4.0 – 46.3% против 40.4% у 4.6 и 41.7% у Sol. Fable 5.1 впереди с 51.8%, но output у него в 8 раз дороже – Terminal-Bench 4.0 – 38% против 20.3% у 4.6, почти вдвое. До Fable (57.9%) при этом как до Марса – EEBench (электротехника) – 64%, лучше всех. – Harvey Legal Agent – 19.6%, тоже первое место. Правда, у Sol там 2.5%, так что юристам пока рано волноваться – GDPval – 1695 Elo, чуть ниже Fable (1735) – HealthBench – 56.7%, тут позади и Sol, и Fable Ещё заявлен полностью новый стек безопасности: пропускает только 3.3% рискованных кибер-запросов и при этом редко отказывает в легитимных. Вот это неожиданно. Для всех фичей безопасности и хитрых проверок я как раз использовал грок. Теперь видимо будут блокировать :( Короче, супер-дешевая и крутая модель для кодинга. Вполне возможно будет в топ-3 на всех бенчах, но дешевле в 5 раз. x.ai/news/grok-4-7
О канале в цифрах
- Создан
- 19 января 2023 г.
- Фото
- 1,3 тыс.
- Видео
- 239
- Файлы
- 58
- Ссылки
- 1,4 тыс.
По данным Telegram на 1 октября 2026 г.
Рейтинги и подборки
Отзывы
Оставить отзыв
Отзывов пока нет. Ваш будет первым.