llama-3.1-70b
Универсальная рабочая лошадка для чата и RAG. Стриминг, function calling, JSON mode.
OpenAI-совместимый API на наших GPU в РФ. Llama 3.1, Qwen 2.5, Mixtral — стриминг, function calling, JSON mode. Fine-tuning на B300. ФЗ-152 совместимо. Без vendor lock и без перевода данных за границу.
Llama · Qwen · Mixtral · embeddings · fine-tuning · ФЗ-152
Frontier-модели от OpenAI и Anthropic — отличные, но за границей. Open-source-модели в один клик не найти. Своя VM с vLLM — хрупко. Мы сделали то, что между.
Тот же endpoint, тот же SDK. Curl с Authorization-bearer, Python openai с base_url — в обоих случаях ответ за ~80 мс с GPU в РФ.
# drop-in замена openai api
$ curl https://api.h3llo.cloud/v1/chat/completions \
-H "Authorization: Bearer h3llo_•••" \
-H "Content-Type: application/json" \
-d '{
"model": "llama-3.1-70b",
"stream": true,
"messages": [
{"role": "user", "content": "Объясни Raft за 3 предложения"}
]
}'
# через ~80 мс — первый токен:
data: {"choices":[{"delta":{"content":"Raft"}}]}
data: {"choices":[{"delta":{"content":" — алгоритм"}}]}
data: {"choices":[{"delta":{"content":" консенсуса..."}}]}# тот же openai SDK, изменён только base_url
from openai import OpenAI
client = OpenAI(
base_url="https://api.h3llo.cloud/v1",
api_key="h3llo_•••",
)
resp = client.chat.completions.create(
model="llama-3.1-70b",
messages=[{"role": "user", "content": "..."}],
stream=True,
)
for chunk in resp:
print(chunk.choices[0].delta.content, end="")Цены в рублях, посекундный биллинг. Контекст — фактический, без скрытых ограничений. TPS измерены при batch-size 1, int8-квантизация, B300 MIG 141 ГБ.
Универсальная рабочая лошадка для чата и RAG. Стриминг, function calling, JSON mode.
Frontier-класс для самых сложных задач. Reasoning, длинные цепочки, агенты.
Самая дешёвая модель в каталоге. Идеально для batch-инференса и простых задач.
Сильна на коде и многоязычии. Альтернатива Llama 70B с лучшим китайским/русским.
Средний класс — баланс цены и качества. Подходит для агентов и tool use.
Mixture-of-Experts: 141 B параметров, активны 39 B. Хорош на reasoning и multi-turn.
Multilingual embeddings для RAG. 4 096-мерный вектор, sentence-aware.
Дешёвая multilingual модель для embeddings — 100+ языков, 1 024-мерный вектор.
Embedding-модели + чат-инференс с function calling. p99 ≤ 800 мс на корпусе из 4 млн документов.
Function calling, JSON mode, structured outputs. Llama 70B и Qwen 72B держат сложные multi-turn разговоры.
Загружаете jsonl, запускаете job на B300. На выходе — endpoint с вашей версией Llama. От 4 часов.
Async-job для миллионов запросов. Дешевле inference в 4×, latency в задаче не критична.
Per-token биллинг для прототипов и переменной нагрузки. Reserved GPU для предсказуемых счётов. Dedicated — для регулируемых рынков.
Реальные практики, бенчмарки, кейсы. Без воды и маркетинга — забираете PDF, в понедельник применяете.
Llama 3.1 70B, Qwen 2.5: TPS, latency p99, стоимость 1М токенов на разных батчах. ~15 мин.
→Гайд · 28 стрКак мы держим p95 ≤ 800 мс на корпусе из 4 млн документов. С формулами и кодом. ~30 мин.
→Кейс · HyperionЧто мерили, что оптимизировали, какие батчи держим. Реальные цифры до/после. ~25 мин.
→Чек-лист · PDFКачество датасета, валидация, eval-метрики, rollback. Что обязательно проверить. ~20 мин.
→Гайд · 22 стрThreat-модель для LLM-сервиса в продакшене. С примерами и приоритетами. ~25 мин.
→Шаблоны · GitHubProduction-ready: gateway, OpenAI-compat proxy, Qdrant, Grafana. Для dev/staging/prod.
→Не переписываете SDK. Не учите новый API. Просто меняете base_url — и ваш код работает на наших моделях в РФ.
`h3llo auth login` · `h3llo ai key create` — за 30 секунд.
`https://api.openai.com/v1` → `https://api.h3llo.cloud/v1`. Всё.
`model: "llama-3.1-70b"` вместо `gpt-4`. Стриминг работает.
Ваш код не меняется — только endpoint. Function calling, JSON mode, embeddings — всё на месте.
Без миграций, без переписывания, без vendor lock. Получаете ключ, меняете base_url — работает.