DeepSeek

DeepSeek: все, що вам потрібно знати про китайський AI-чатбот DeepSeek

Китайський AI-чатбот DeepSeek став вірусним, і справді може стати вашим улюбленим штучним інтелектом для роботи з текстами.

Китайська AI-лабораторія DeepSeek увійшла в історію AI після того, як її додаток-чатбот піднявся на вершину чартів Apple App Store (а також Google Play).

Моделі штучного інтелекту DeepSeek, які були навчені з використанням обчислювально ефективних методів, змусили аналітиків з Волл-стріт та технологів задуматися, чи зможуть США зберегти свою перевагу в гонці AI та чи збережеться попит на AI-чіпи.

Але звідки взявся DeepSeek і як він так швидко здобув міжнародну славу? Американське видання TechCrunch зібрало усі факти, які треба знати про цей штучний інтелект та феномен його раптового світового успіху.

Походження DeepSeek

DeepSeek підтримується High-Flyer Capital Management, китайським кількісним хедж-фондом, який використовує AI для прийняття торгових рішень.

Ентузіаст AI Лян Веньфен заснував High-Flyer у 2015 році. Веньфен, який, за повідомленнями, почав займатися торгівлею ще студентом Чжецзянського університету, запустив High-Flyer Capital Management як хедж-фонд у 2019 році, зосереджений на розробці та впровадженні AI-алгоритмів.

У 2023 році High-Flyer створив DeepSeek як лабораторію, присвячену дослідженню AI-інструментів окремо від свого фінансового бізнесу. За підтримки High-Flyer як одного з інвесторів, лабораторія відокремилася в окрему компанію, також названу DeepSeek.

З першого дня DeepSeek будував власні кластери дата-центрів для навчання моделей. Але, як і інші AI-компанії в Китаї, DeepSeek постраждав від заборон США на експорт апаратного забезпечення. Для навчання однієї зі своїх останніх моделей компанія була змушена використовувати чіпи Nvidia H800, менш потужну версію чіпа H100, доступного для американських компаній.

Технічна команда DeepSeek, як повідомляється, складається з молодих фахівців. Компанія активно залучає докторів наук з провідних китайських університетів. DeepSeek також наймає людей без будь-якого досвіду в комп’ютерних науках, щоб допомогти своїм технологіям краще розуміти широкий спектр предметів.

Потужні моделі DeepSeek

DeepSeek представив свій перший набір моделей — DeepSeek Coder, DeepSeek LLM та DeepSeek Chat — у листопаді 2023 року. Але лише минулої весни, коли стартап випустив своє наступне покоління моделей DeepSeek-V2, AI-індустрія почала звертати на нього увагу.

DeepSeek-V2, універсальна система аналізу тексту та зображень, показала відмінні результати в різних AI-бенчмарках — і була набагато дешевшою в експлуатації, ніж порівнянні моделі того часу. Це змусило внутрішніх конкурентів DeepSeek, включаючи ByteDance та Alibaba, знизити ціни на використання деяких своїх моделей і зробити інші повністю безкоштовними.

DeepSeek-V3, запущена в грудні 2024 року, лише додала до популярності DeepSeek.

За внутрішніми тестами DeepSeek, DeepSeek V3 перевершує як завантажувані, відкриті моделі, такі як Llama від Meta, так і “закриті” моделі, до яких можна отримати доступ лише через API, такі як GPT-4o від OpenAI.

Не менш вражаючою є “модель міркування” R1 від DeepSeek. Випущена в січні, DeepSeek стверджує, що R1 показує такі ж результати, як і модель o1 від OpenAI, за ключовими бенчмарками.

Будучи моделлю міркування, R1 ефективно перевіряє себе на факти, що допомагає уникнути деяких підводних каменів, які зазвичай спотикають моделі. Моделям міркування потрібно трохи більше часу — зазвичай від секунд до хвилин — щоб дійти до рішень порівняно з типовою неміркуючою моделлю. Перевага полягає в тому, що вони, як правило, більш надійні в таких областях, як фізика, наука та математика.

Однак є і недоліки у R1, DeepSeek V3 та інших моделях DeepSeek. Будучи розробленими в Китаї AI, вони підлягають оцінці китайським інтернет-регулятором, щоб забезпечити, що їхні відповіді “втілюють основні соціалістичні цінності”. Наприклад, у додатку-чатботі DeepSeek, R1 не відповідає на запитання про площу Тяньаньмень або автономію Тайваню.

Руйнівний підхід

Якщо у DeepSeek є бізнес-модель, то не зовсім зрозуміло, яка саме.Компанія встановлює ціни на свої продукти та послуги значно нижче ринкової вартості — і надає інші безкоштовно.

Вона також не приймає інвестиції, незважаючи на великий інтерес венчурних капіталістів.

За словами DeepSeek, прориви в ефективності дозволили їй підтримувати надзвичайну конкурентоспроможність за витратами. Однак деякі експерти ставлять під сумнів цифри, надані компанією.

Як би там не було, розробники прийняли моделі DeepSeek, які не є відкритим кодом у загальноприйнятому розумінні, але доступні за ліцензіями, що дозволяють комерційне використання.

За словами Клема Деланга, CEO Hugging Face, однієї з платформ, що розміщує моделі DeepSeek, розробники створили понад 500 похідних моделей R1, які в сумі були завантажені 2,5 мільйона разів.

Успіх DeepSeek у боротьбі з більшими та більш усталеними конкурентами називають як “переворотом в AI”, так і “надмірно роздутим хайпом”. Компанія зіграла певну роль у зниженні ціни акцій Nvidia на 18% у січні та спровокувала публічну реакцію від CEO OpenAI Сема Альтмана. У березні департаменти Міністерства торгівлі США заявили, що DeepSeek буде заборонено на державних пристроях.

Реакція ринку та майбутнє DeepSeek

Microsoft оголосила, що DeepSeek доступний на її платформі Azure AI Foundry, яка об’єднує AI-сервіси для підприємств. Коли CEO Meta Марк Цукерберг під час першого квартального звіту був запитаний про вплив DeepSeek на витрати Meta на AI, він відповів, що інвестиції в AI-інфраструктуру залишатимуться “стратегічною перевагою” компанії.

У березні OpenAI назвала DeepSeek “державним субсидованим” та “контрольованим державою” проєктом і рекомендувала уряду США розглянути можливість заборони моделей DeepSeek.

На четвертому квартальному звіті Nvidia, CEO Дженсен Хуанг відзначив “відмінні інновації” DeepSeek, зазначивши, що моделі “міркування”, такі як їхня R1, потребують набагато більше обчислювальних ресурсів, що вигідно для виробників чіпів.

Проте деякі компанії та країни почали забороняти DeepSeek. Південна Корея оголосила про повну заборону сервісу. Уряд штату Нью-Йорк також заборонив використання DeepSeek на державних пристроях.

Що чекає на DeepSeek у майбутньому — поки що невідомо. Покращені моделі AI, ймовірно, неминучі. Але зростаюча настороженість уряду США щодо передбачуваного шкідливого впливу іноземних AI-компаній може стати серйозним викликом для DeepSeek. У березні The Wall Street Journal повідомила, що уряд США, найімовірніше, повністю заборонить DeepSeek на державних пристроях.

ДжерелоTechCrunch

Слідкуй за PRO Ідеї

Щоб не пропускати нові матеріали — підписуйся там, де тобі зручно

Коментарі

Поки що немає коментарів. Чому б вам не розпочати обговорення?

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *