Новости ИИ, 2 октября: Olmo-core 3 добавляет инфраструктуру для обучения крупных MoE
В выпуске: Olmo-core 3 добавляет инфраструктуру для обучения крупных MoE; Cloudflare выпустила модели решений Clef и Clef-flash; Cloudflare AI Search получил поддержку изображений и OCR и другое.
Olmo-core 3 добавляет инфраструктуру для обучения крупных MoE
Hugging Face выпустила Olmo-core 3 — обновлённую открытую систему обучения моделей с архитектурой mixture-of-experts. Она использует распределённый параллелизм данных вместо прежнего подхода с полным разделением модели: эксперты остаются на GPU, а к ним направляются нужные данные. В тесте на восьми NVIDIA B300 модель с 47 миллиардами параметров обрабатывала 52,000 токенов в секунду на GPU против 19,400 в предыдущей реализации — примерно в 2.7 раза больше. При этом в другом тесте увеличение пула экспертов с 8 до 128 сохранило число активных параметров на токен примерно на уровне 3.2B, а пропускная способность снизилась менее чем на 5%.
В системе также используются параллелизм экспертов и конвейера, распределённый оптимизатор, групповые вычисления GEMM и формат MXFP8. В тесте на четырёх NVIDIA B300 MXFP8 повысил пропускную способность примерно на 21% относительно BF16, а пиковое использование памяти сократилось со 103 GiB до 95 GiB. Olmo-core 3 проверили и на конфигурации модели с 1.2 триллиона параметров, распределённой на 512 GPU.
Что это значит для разработчиков. Открытый стек даёт разработчикам и исследователям инструменты для обучения MoE-моделей и позволяет оценить влияние разных методов распределения вычислений на скорость и использование памяти.
Источник: Hugging Face
Cloudflare выпустила модели решений Clef и Clef-flash
Cloudflare разместила на Workers AI модели для классификации и принятия решений Clef и Clef-flash. Они выдают структурированные ответы с типами и вероятностями, совместимы с Jev API и опубликованы на Hugging Face под лицензией Apache 2.0. Clef поддерживает обработку изображений и контекстное окно в 64k; Clef-flash предназначена для задач, чувствительных к задержке. Компания также представила продукт для дообучения моделей с помощью обучения с подкреплением: сначала настройку можно проводить при участии команды Cloudflare, позднее должна появиться платформа самообслуживания.
В тесте Cloudflare на классификацию домена Clef обработала сайт за 2,2 секунды и выдала несколько категорий с вероятностями; gpt-oss-120b выполнила тот же сценарий за 4,7 секунды и вернула две категории. В оценке по набору Typesafe модели Clef превзошли Jev в трёх из четырёх областей, а в 43 тестах показали меньшую задержку, чем другие модели решений, кроме Laya. Cloudflare сообщает, что не читает и не хранит запросы и ответы пользователей и не использует их для обучения, если пользователь отдельно не воспользуется дообучением.
Что это значит для разработчиков. Структурированные ответы с вероятностями можно использовать в коде для маршрутизации задач или передачи их человеку. Совместимость с Jev API позволяет интегрировать Clef в существующие рабочие процессы с этим API.
Источник: Cloudflare AI · Попробовать в GateLLM: gpt-oss-120b
Cloudflare AI Search получил поддержку изображений и OCR
Cloudflare перевела AI Search в общий доступ. Сервис объединяет Workers AI, Vectorize, R2 и Browser Run в управляемый конвейер индексации и поиска. Теперь он может создавать векторные представления изображений, а также распознавать текст на страницах PDF с помощью OCR. Для текстовых файлов и PDF увеличен максимальный размер: с 4 до 10 MiB.
Нативный поиск по изображениям доступен с моделью Qwen3-VL-Embedding: она сохраняет визуальные признаки и позволяет искать по изображению или текстовому описанию. Если используется текстовая модель, AI Search сначала преобразует изображение в текст с помощью ToMarkdown. OCR доступен всем аккаунтам; обработка распознанных изображений тарифицируется как токены обработки при загрузке. Cloudflare начнёт взимать плату за AI Search, сохранив бесплатный тарифный лимит для Workers.
Что это значит для разработчиков. Разработчики могут индексировать сканированные PDF и искать изображения по визуальному сходству, а не только по подписям. Увеличение лимита размера файлов упрощает обработку более крупных документов.
Источник: Cloudflare AI
Amazon S3 Vectors подключили к памяти NVIDIA NeMo Agent Toolkit
AWS описывает, как использовать Amazon S3 Vectors в качестве постоянного хранилища памяти для агентов NVIDIA NeMo Agent Toolkit (NAT), развернутых на Amazon EKS. Для интеграции предлагается создать собственный плагин MemoryEditor: он сохраняет воспоминания как векторы, формирует эмбеддинги с помощью Amazon Titan Text Embeddings V2 и преобразует фильтры поиска в запросы к метаданным S3 Vectors. Индекс настраивается на 1024 измерения — размерность эмбеддингов этой модели.
В конфигурации NAT плагин подключается к рабочему процессу агента через auto_memory_agent. Обёртка автоматически сохраняет сообщения пользователя и ответы агента, а перед вызовом агента добавляет в контекст найденные релевантные сведения; отдельно вызывать инструменты памяти модели не требуется. Для работы с такими данными рекомендуется определить срок хранения, не помещать персональные данные в метаданные и ограничивать доступ с помощью отдельных индексов для арендаторов и IAM-политик с минимальными правами.
Что это значит для разработчиков. Разработчики могут использовать S3 Vectors как постоянный бэкенд памяти в NAT и автоматизировать сохранение и поиск контекста. Рекомендации по хранению и доступу помогают учесть обработку чувствительных данных.
Источник: AWS Machine Learning
Apple представила подход RLTL;DR для самоулучшения моделей
Apple ML Research описала RLTL;DR — подход к самоулучшению на основе обучения с проверяемыми наградами. В обычной схеме агент делает несколько попыток, а обучение ориентируется на успешные. Такой подход затруднён, если задача настолько сложна, что вероятность успеха мала или отсутствует. Также для таких задач может не быть моделей-учителей или примеров решений. В RLTL;DR после неудачной попытки агенту показывают выводы проверяющей системы. Затем он формулирует собственную обратную связь в виде одного краткого вывода TL;DR.
Что это значит для разработчиков. Подход предназначен для самоулучшения в условиях, когда агенту трудно решить задачу, а моделей-учителей и примеров решений нет.
Источник: Apple ML Research
Автономные ML-агенты используют всё более сложные системы
Автономные агенты для машинного обучения показывают прогресс в публичных рейтингах. Их часто дополняют сложной инфраструктурой: системами координации нескольких агентов и отдельными агентами для поиска информации. Такой подход связывают с замедлением прогресса в длительных циклах работы и ограниченными возможностями базовых инструментов LLM.
При этом меньше внимания уделяют усовершенствованным агентам для программирования, которые напрямую работают в среде выполнения через инструменты чтения, записи и bash. В публикации ставится вопрос о том, насколько сложная инфраструктура нужна сильному агенту для автономной разработки в области машинного обучения.
Источник: Apple ML Research
Новое в каталоге GateLLM
- Pareto 26.10 Preview от unbiased — 240 ₽ / 960 ₽ за 1M токенов