Together AI

AI Native Cloud от Together AI: serverless и dedicated inference open-source моделей (DeepSeek V4, Llama 3.3, Qwen, GLM, Kimi K2.6 и др.), GPU-кластеры NVIDIA H100/H200/B200 и fine-tuning. Cobaza Tri Dao (FlashAttention), Percy Liang.

РазработчикTogether AI

Что такое Together AI

Together AI — это облачная AI-платформа, которая объединяет доступ к десяткам открытых языковых моделей (DeepSeek, Llama, Qwen, GLM, Kimi и других) и мощным GPU-кластерам NVIDIA H100/H200/B200. Сервис позиционируется как «AI-native cloud» — то есть инфраструктура, изначально спроектированная под задачи машинного обучения, а не адаптированная из обычного облака.

Основатели проекта — Крис Ре, Кобаз Три Дао (соавтор FlashAttention) и Перси Лян из Стэнфорда. Это не просто хостинг моделей: Together AI позволяет запускать инференс в serverless-режиме (платите за запросы) или арендовать выделенные кластеры для масштабных нагрузок. Платформа также поддерживает fine-tuning — дообучение открытых моделей под конкретные бизнес-задачи, что делает её серьёзной альтернативой проприетарным API вроде OpenAI.

Ключевые возможности

  • Serverless-инференс — вызов моделей через API без управления серверами, оплата за фактическое использование.
  • Выделенные GPU-кластеры — аренда узлов NVIDIA H100/H200/B200 для тяжёлых нагрузок и непрерывной работы.
  • Библиотека открытых моделей — DeepSeek V4, Llama 3.3, Qwen, GLM, Kimi K2.6 и сотни других в один клик.
  • Fine-tuning — дообучение моделей на собственных данных с автоматическим управлением вычислительными ресурсами.
  • FlashAttention и оптимизация — использование передовых техник внимания от соавтора технологии для ускорения инференса.
  • Совместимость с OpenAI SDK — переключение между провайдерами без переписывания кода.

Кому подойдёт

Стартапам и продуктовым командам — если нужно быстро прототипировать AI-функции без покупки дорогого железа. Serverless-режим позволяет начать с минимальным бюджетом.

Компаниям с чувствительными данными — открытые модели можно развернуть на выделенных кластерах, сохраняя контроль над информацией и не отправляя её сторонним API.

Исследователям и ML-инженерам — платформа удобна для экспериментов с fine-tuning и сравнения архитектур. Наличие H200 и B200 даёт доступ к самым свежим GPU.

Разработчикам AI-продуктов для бизнеса — чат-боты, аналитические ассистенты, генерация контента, обработка документов — всё, что требует стабильного и предсказуемого инференса.

Плюсы и минусы

Плюсы:

  • Широкий выбор актуальных open-source моделей — не привязаны к одному вендору.
  • Прозрачное ценообразование: serverless-режим без скрытых комиссий.
  • Высокая скорость инференса благодаря оптимизациям FlashAttention.
  • Возможность арендовать кластеры под пиковые нагрузки.
  • Активное комьюнити и оперативная поддержка новых моделей.

Минусы:

  • Интерфейс и документация ориентированы на технических специалистов — новичкам сложно разобраться.
  • Для постоянных высоких нагрузок выделенные кластеры обходятся дороже, чем у крупных облаков.
  • Нет встроенных инструментов для нетехнических пользователей (например, визуальных конструкторов).

Частые вопросы

Чем Together AI отличается от OpenAI API?

Together AI работает только с открытыми моделями (DeepSeek, Llama и др.), которые можно дообучать и разворачивать на своих мощностях. У OpenAI — проприетарные модели с закрытым кодом. Если вам нужна гибкость и контроль — Together AI; если максимальное качество «из коробки» без настроек — OpenAI.

Как происходит оплата serverless-режима?

Вы платите за каждый обработанный запрос — обычно за миллион токенов на входе и выходе. Цены фиксируются для каждой модели. Такой подход удобен для проектов с неравномерной нагрузкой.

Можно ли перенести уже обученную модель в Together AI?

Да. Платформа поддерживает загрузку весов популярных open-source архитектур (Llama, Mistral, Qwen и др.) в формате Hugging Face. После загрузки модель можно использовать через API или дообудить.

Насколько безопасны данные при использовании Together AI?

Для конфиденциальных данных рекомендуется аренда выделенных кластеров — в этом случае инфраструктура изолирована. В serverless-режиме данные передаются через API, поэтому для строгих требований безопасности лучше выбрать выделенный вариант.

Часто задаваемые вопросы

Что такое Together AI и кто за ним стоит?

Together AI — full-stack AI Native Cloud для production AI: serverless и dedicated inference, GPU-кластеры NVIDIA H100/H200/B200, fine-tuning open-source моделей и sandbox. Founders — Vipul Ved Prakash (CEO), Ce Zhang (CTO), Chris Ré, Tri Dao (автор FlashAttention) и Percy Liang (создатель HELM benchmark). Команда отвечает за прорывные ML-наработки: FlashAttention 1–4, ThunderKittens, Mamba 1–3, ATLAS, RedPajama.

Сколько стоит Serverless Inference?

Цена за 1M токенов зависит от модели. Дешёвые модели: gpt-oss-20B — $0,05 (input) / $0,20 (output), LFM2 24B A2B — $0,03 / $0,12, Llama 3.3 70B — $0,88 / $0,88. Топовые: DeepSeek V4 Pro — $2,10 / $4,40, Kimi K2.6 — $1,20 / $4,50, GLM-5.1 — $1,40 / $4,40, DeepSeek-R1-0528 — $3,00 / $7,00. Batch API даёт экономию ~50% на большинстве моделей.

Сколько стоит Dedicated Inference и GPU Clusters?

Dedicated Inference: 1× H100 80GB — $3,99/час, 1× H200 141GB — $5,49/час, 1× B200 180GB — $9,95/час. GPU Clusters on-demand: HGX H100 — $3,49/час, H200 — $4,19/час, B200 — $7,49/час. Reserved (4–6 месяцев): H100 от $2,55, H200 от $2,89, B200 от $6,39 в час. NVIDIA GB200 / GB300 NVL72 — по запросу.

Какие модели доступны через Together AI?

Десятки open-source моделей: GLM-5.1 / GLM-5, MiniMax M2.7 / M2.5, Kimi K2.6 / K2.5, DeepSeek V4 Pro / V3.1 / R1-0528, всё семейство Qwen 3 (включая 397B-A17B и Coder), Llama 3.3 70B и 3 8B Instruct Lite, gpt-oss-120B / 20B (open-weights от OpenAI), LFM2 24B A2B, Cogito v2.1 671B, Gemma 4 31B и 3n E4B Instruct. Модальности — chat, vision, image, audio, video, embeddings, rerank.

Есть ли OpenAI-совместимый API?

Да. Serverless Inference API Together AI совместим со стандартом OpenAI — достаточно заменить базовый URL и API-ключ, существующий код приложения менять не нужно. Это позволяет быстро мигрировать проекты с OpenAI на open-source модели через Together. Доступны официальные SDK для Python и TypeScript.

Как работает Fine-Tuning?

Together AI предлагает Supervised Fine-Tuning (SFT) и Direct Preference Optimization (DPO) на open-source моделях до 100B. Цены за 1M токенов: до 16B — LoRA $0,48 / Full $0,54 (DPO дороже в ~2,5 раза), 17B–69B — LoRA $1,50 / Full $1,65, 70–100B — LoRA $2,90 / Full $3,20. Стоимость = (размер датасета × число эпох) + опциональная валидация.

Какая поддержка предоставляется?

Четыре уровня: Build (community через Discord), Standard (Scale tier API, PT business hours), Silver (Enterprise API — SLA P0 1 час / P1 4 часа / P2 8 часов / P3 2 дня, Slack-канал), Gold (для GPU Cluster customers — 24×7×365 P0, dedicated Technical Account Manager, 20 часов training, priority queueing; стоит 10% от контракта или включён для GPU-cluster клиентов).

Можно ли пользоваться Together AI из России?

Сервис ориентирован на глобальный рынок, оплата идёт в долларах. Прямой оплаты с российских карт и работы по расчётному счёту РФ нет — потребуются зарубежные посредники, корпоративная карта другой юрисдикции или оформление через зарубежное юрлицо. Для стабильного доступа из РФ может потребоваться VPN — сервис не рассчитан на санкционные географии.

Альтернативы Together AI