Работа обученной модели на запросе пользователя, и то, за что берут деньги
Один прогон готовой модели: пользователь прислал запрос, модель выдала ответ. По-английски inference. Это отдельная от обучения статья расходов — обучение разовое, а обращения идут постоянно.
Почему это важно: у модели с открытыми весами продавать нечего, кроме обращений. Отсюда странная на первый взгляд конструкция: веса раздают бесплатно, а деньги берут за вызовы к своим серверам.
Единственный раскрытый расчёт. За сутки 27–28 февраля 2025 года DeepSeek показала дневную себестоимость обращений 87 072 доллара при теоретической дневной выручке 562 027 долларов — наценка 545 %. Компания сама оговорила, что настоящая выручка ниже: часть услуг бесплатна, часть идёт по ночным скидкам. Больше таких данных она не публиковала.
Как считать чужие обещания. Себестоимость обращения складывается из аренды вычислителей и электричества и падает от загрузки: тот же сервер, обслуживающий вдвое больше запросов, даёт вдвое меньшую себестоимость на запрос. Поэтому «дешёвая модель» — это почти всегда утверждение о загрузке, а не о самой модели.
Ещё пишут: инференс, inference.