DeepSeek (тел моделе)
DeepSeek — бу ачык чыгышлы тел модельләре гаиләсе, шул ук исемдәге Кытай ясалма фәһем лабораториясе тарафыннан эшләнә. Чат-ботлы зур тел моделенең өр яңа версияләре — DeepSeek-V3 һәм логик мәсьәләләрне чишү өчен «уйлаучы» DeepSeek— R1 — табигый телләрне эшкәртүдә, математик мәсьәләләрдә һәм программалаштыруда конкурентларының эшләнмәләре белән чагыштырганда тигез яки югарырак нәтиҗәләр күрсәтәләр (GPT-4О яки Open AI-o1, шулай ук башка көнбатыш компанияләр тәкъдим иткән охшаш модельләр)[1][2][3][4].
Шул ук вакытта, DeepSeek раславынча, аларның модельләре, укыту һәм эшне тәэмин итү өчен, ресурсларны күпкә азрак таләп итә, Россия, яисә башка ил кулланучылары өчен керү мөмкинлеген чикләми[2][5]. Моннан тыш, модельләрне куллану бәясе көнбатыш көндәшләренә караганда уртача 96 % ка арзанрак[6][7].
2025 елның 20 гыйнварында DeepSeek-R1 моделенең базарга чыгуы АКШ технологик компанияләренең (ясалма фәһем өлкәсендә эшләүче, исәпләү җиһазлары җитештерүче) базар котировкаларының масштаблы җимерелүенә китерә, шул ук Көнбатыш ЯИ–инфраструктурасына тотылган күпмиллиардлы кертемнәрнең акланган булуына шик уята, җиһазларга таләпләрнең арттырылуына һәм аның бәясенә карата бәхәсләр тудыра[8][9].
Үсеш тарихы
- Төп мәкалә: DeepSeek
DeepSeek 2015 елда кытай миллиардеры һәм ясалма фәһем өлкәсендә энтузиаст Лян Вэньфан тарафыннан нигезләнгән High-Flyer Кытай хедж-фонды юнәлешеннән мөстәкыйль стартап булып бүленеп чыга. 2024 елның июлендә ул заманча генератив модельләрнең чикләнгәнлеге турында белдерә, ә яңа компаниянең бурычы дип гомуми ясалма фәһемгә (AGI) ирешүне билгели[10]. 2024 елның ноябрендә компания башлыгы ачык чыганаклы продуктлар булдыру идеясе тарафдары булуын һәм DeepSeek түләүле хезмәтләрен алга таба киңәйтү буенча планнары булмавын тагын бер кат раслый[11].
DeepSeek продуктларын тарату шартлары
Ясалма фәһем өлкәсендәге әйдәп бара торган көнбатыш компанияләреннән (OpenAI, Meta яки Anthropic) аермалы буларак, DeepSeek-ның барлык тел модельләре баштан ук MIT ирекле лицензиясе белән таратыла. 2025 елның гыйнварында DeepSeek V3 һәм DeepSeek R-1 уңышын шәрехләп, Meta-ның ясалма фәһем буенча баш белгече Ян Лекун белдергәнчә, «ясалма фәһем өлкәсендә ачык чыгышлы модельләр проприетар чишелештән өстенлекләрен расладылар»[12].
Релизлар
2023 елның ноябреннән DeepSeek зур тел модельләренең 3 генерациясен тәкъдим итә.
DeepSeek Coder һәм DeepSeek LLM
DeepSeek Coder-дан беренче нейрочелтәр 2023 елның 2 ноябрендә тәкъдим ителә; шул ук айның 29 ында 67 млрд параметрлы DeepSeek LLM беренче универсаль зур тел моделе чыга, ул вакытта мөмкинлекләре буенча LLama 2-дән өстен һәм GPT-4-кә якын була[13], әмма кайбер мәгълүматлар буенча масштаблаштыру һәм исәпләү нәтиҗәлелеге белән проблемалары була[13]. Шул ук вакытта беренче тапкыр DeepSeek LLM нигезендә эшли торган интеллектуаль чат-бот тәкъдим ителә.
Беренче модельнең барлыгы 8 варианты эшләнгән: дүрт стандарт өйрәтелгән (Base) һәм дүрт инструкцияләр җыелмасы (Instruct) белән нечкә көйләнеш үткән вариантлары. Алар барысы да Llama модельләре куллан «игътибар» механизмына охшаш трансформер архитектурага таяна.
- Алдан өйрәтү 1,8 трлн токенда уза (1 млн токен якынча 750 мең сүзгә тигез)[14].
- Long-context pretraining (LCP, инглиз теленнән «озын контекст эзлеклелекләре белән эшләргә өйрәтү») база модельләре 200 млрд.токенда уза, бу челтәр тарафыннан эшкәртелә торган контекстның максималь озынлыгын 4 тән 16 мең токенга кадәр арттырырга мөмкинлек бирә.
- Instruct модельләрен нечкә көйләнеше 2 млрд токен күләмендәге инструкцияләр җыелмалары нигезендә уза[15].
DeepSeek-V2
2024 елның маенда DeepSeek тел моделенең икенче версиясен дүрт вариантта чыгара: стандарт (V2), кечерәйтелгән (V2-Lite), шулай ук стандарт чат-бот (V2-Chat) һәм аның кечерәйтелгән версиясе (V2-Chat-Lite).
Өлкән модельләрдә параметрлар саны 236 млрд-ка кадәр арткан; алдан укыту 8,1 трлн токенда үткәрелгән, ә контекстның максималь озынлыгы 128 мең токенга кадәр үскән.
Модель беренче версия белән чагыштырганда шактый архитектур үзгәрешләр кичерә: анда түбән ранглы аппроксимация нигезендә Multi-head Learning Attention (MLA, инглизчә «күптөрле игътибар белән укыту»)[16] машина өйрәтүе инновацион методы кулланылган, бу модельне өйрәтүнең бәясен һәм вакытын күп тапкырлар киметергә мөмкинлек бирә[16][17]. Моннан тыш, компания модельдә Mixture of Experts (MOE, инглизчә «экспертлар катнашмасы») принцибын эшләп куллана: модель күпсанлы челтәрләрдән тора, аларның һәркайсы үзе махсуслашкан белем өлкәсе өчен җавап бирә һәм җавап эзләүгә кирәк булганда гына кушыла[17][18].
MLA һәм MoE комбинациясе миллион токенны эшкәртү бәясен 2 юаньга калдырырга мөмкинлек бирә, шул ук ChatGPT-да бу күрсәткеч 2,5 долларны тәшкил итә[19]. Моннан тыш, Deep Seek-V2 конкурентлык сәләтен дә күрсәтә: Ватерлоо университеты каршындагы ясалма фәһем лабораторияләрен иң яхшы зур тел модельләре рейтингында 7 урынга урнаштыра[20].
DeepSeek-V3
2024 елның декабрендә ачык кулланылышка ике вариантта модельнең өченче генерациясе чыга: стандарт (V3-Base) һәм чат-бот (V3), ул 671 млрд параметрдан тора һәм 14,8 трлн токенга укыту уза. DeepSeek-V2 дә сыналган архитектурада төзелгән нейрочелтәр текстларны анализларга һәм сөйләргә, иң мөһимен аерып күрсәтеп, тәрҗемәләр эшләргә, шулай ук математик мәсьәләләрне чишәргә һәм программаларны OpenAI, Meta яки Anthropic тестларында иң алга киткән модельләр белән бер дәрәҗәдә язарга сәләтле[2]: Deepseek-V3 тестларда Llama 3.1 Qwen 2.5 өстенлеген күрсәтә һәм GPT-4о һәм Claude 3.5 Sonnet дәрәҗәсенә туры килә[2][3].
Deepseek тарафыннан тәкъдим ителгән түләүсез кушымта — «DeepSeek-AI Assistant» чат-боты — 2025 елның гыйнвар ахырына дөньяда иң күп йөкләнешле кушымта була, АКШта иң югары бәяләнгән түләүсез кушымталар рейтингында ChatGPT-ны да узып китә[21]. Моннан тыш, DeepSeek санкцияләр сәясәтен хупламый һәм үз моделенә керү мөмкинлеген берничек тә чикләми, дөньяның барлык илләреннән, шул исәптән Россиядән дә, кулланучылар өчен тигез мөмкинлекләр бирә[2].
Шул ук вакытта модельне эшләүчеләр раславынча, аны укыту вакыты экспорт контроле таләпләрен үтәү өчен киметелгән 2000 тирәсе NVIDIA видеокарталары массивында нибары 55 көнне тәшкил иткән, укыту бәясе, Llama яисәи GPT-4o белән чагыштырганда ким булып, нибары 5,5 млн доллар тәшкил иткән[7][22].
Модельнең үзенчәлекләре
Мондый нәтиҗәлелек күрсәткечләренә Deep Seek архитектурасының үзенчәлекләре ярдәмендә ирешелгән:
- Multi-token Prediction (MTP) методы, җөмләнең төрле өлешләрен бер үк вакытта анализларга һәм берничә сүзне алдан әйтергә мөмкинлек бирә, бу модельнең эш тизлеген һәм аның җавапларының төгәллеген арттыра.
- Mixture of Experts (MoE) технологиясе, ул модельгә махсус белем өлкәләре буенча сорауларга кирәкле җавап эзләү өчен кулланыла торган «эксперт» подсетьләрен кертә. Deep Seek-V3 тә шундый 256 нейрочелтәр урнаштырылган, шуларның сигезе даими рәвештә актив, ә калганнары билгеле бер бурычларны хәл итү өчен кирәк булганда тоташа.
- Түбән ранглы аппроксимация нигезендә игътибар механизмын көйләүгә multi-head Latent Attention (MLA) якын килүен кертү элек исәпләнгән мәгълүматка тиз керү өчен җавап бирүче «мәгънә-ачкыч» (KV-cache) парларын саклау структурасының зурлыкларын һәм эш тизлеген сизелерлек киметүгә китерә[23].
DeepSeek-R1
2025 елның 20 гыйнварында DeepSeek AIME һәм MATH математик тестларында open AI-o1 фламга чишелеше дәрәҗәсендә җитештерүчәнлек белән логик һәм математик мәсьәләләрне чишү өчен үзенең DeepSeek R1 уйлаучы моделен тәкъдим итте[4]. Бу модельнең төп үзенчәлеге — кешедә фикерләү процессын кабатлый торган җавапларны адымлап генерацияләү[24][25][26]. Аны эшләгәндә компания укыту вакытында бүләкләүне модельләштерүдә яңа, нәтиҗәлерәк алым куллана[27].
2025 елның гыйнварында акция базары
Укыту һәм куллану өчен күп тапкырлар азрак чыгымнар таләп итә торган модель барлыкка килү 2025 елның 28 гыйнварында технологик компанияләрнең котировкалары ишелүгә китерә. Шулай итеп, нейрочелтәрләрне өйрәтү өчен җиһазлар тәкъдим итә торган NVIDIA компаниясе 600 млрд доллардан артык керемен яисә капитализациянең 18% ка якынын югалткан, бу фонд базары тарихында иң зур җимерелү була[28].
Ясалма фәһем секторы белән бәйле барлык компанияләр диярлек зур югалтулар кичерә — Аркадий Воложаның Nebius (-4 %), Broadcom (-17,3 %), AMD (-8 %), Palantir (-7 %), Microsoft (-3 %), шулай ук дата-үзәкләрен электр энергиясе белән тәэмин иткән Constellation Energy (-21 %) һәм Vistra (-29 %). NASDAQ индексы 3,5% ка, ә S&P 1,8% ка утырган. Нәтиҗәдә, Америка биржалары 1 трлн АКШ долларыннан артык керемен югалткан[28], ә криптовалюта бәясе 7 % ка төшкән[29].
Технологияләрне урлауда гаепләү
29 гыйнварда Microsoft һәм аңа караган OpenAI DeepSeek-ка каршы тикшерү процессын башлый. Компанияләр раславынча, Кытай стартабы үз модельләрен OpenAI нейрочелтәрләре тарафыннан генерацияләнгән мәгълүматларга санкцияләргә карамыйча өйрәткән[30]. Америка корпорациясе версиясе буенча, Deep Seek бәйсез эшләнмә түгел, ә OpenAI-ның эшләнгән һәм патентланган модельләрен дистилляцияләү ысулы белән булдырылган[31].
Инновацияләр катализаторы буларак АКШ санкцияләре
Билгеле булганча, DeepSeek модельләрен өйрәтү өчен 2021 елда ук сатып алынган — ягъни АКШ Кытайга карата чипларга чикләүләр керткәнче — NVIDIA A100 видеокарталарын кулланган. Төрле бәяләүләр буенча DeepSeek стартапы карамагында 10 меңгә якын шундый видеокарталар бар[7] (кайбер Көнбатыш экспертлары фикеренчә, компания экспорт рестрикцияләрен үтәү өчен киселгән 40 меңгә якын NVIDIA H800 видеокартасын туплаган[32][33]), бу сан OpenAI яисә Llamaга караганда берничә тапкырга кимрәк (һәр компаниянең 300 меңгә якын видеокартасы бар)[19][34][35].
Тәнкыйть
Claude AI тел модельләренең зур сериясен эшли торган Anthropics компаниясен булдыручы Дарио Амадей фикеренчә, бу хәл, Кытай җитештерүчеләренең бөек нәтиҗәләргә ирешүеннән бигрәк, үзләрен танытырга теләүләре белән бәйле. Амадей, DeepSeek 7–10 ай элек актуаль булган Америка модельләренә якынайтылган модель булдырган, моңа әлбәттә, чыгымнарын киметүнең гадәти тренды кысаларында, азрак акча сарыф иткән. Өстәвенә, Кытай стартабының җитди ресурсларга керү мөмкинлеге бар. Амодей билгеләп үткәнчә, DeepSeek яхшы нәтиҗәләр күрсәткән, тик моны революция дип атарга кирәкми, чөнки чыгымнарның кимүе гадәти трендка туры килә, шул ук вакытта deepseek-V3 гомуми чыгымнары Америка ИИ-лабораторияләре чыгымнары белән чагыштырырлык, моннан тыш, DeepSeek-V3 шау-шу куптарган DeepSeek-R1 белән чагыштырганда инновациялерәк[36].
Искәрмәләр
- ↑ Sharma, Shubham. DeepSeek-V3, ultra-large open-source AI, outperforms Llama and Qwen on launch (2024-12-26). 29 гыйнвар 2025 тикшерелде.
- ↑ 1 2 3 4 5 Нейросеть DeepSeek: что это, возможности, как пользоваться | РБК Тренды. 28 гыйнвар 2025 тикшерелде.
- ↑ 1 2 DeepSeek-V3: Китайская языковая модель превзошла Claude 3.5 Sonnet в работе с кодом. 28 гыйнвар 2025 тикшерелде.
- ↑ 1 2 DataSecrets. Разбираемся, как устроена R1 – новая бесплатная ризонинг модель ИИ из Китая, работающая на уровне o1 от OpenAI. Habr.ru (21 гыйнвар 2025).
- ↑ Разбираемся, как устроена R1 – новая бесплатная ризонинг модель ИИ из Китая, работающая на уровне o1 от OpenAI. 28 гыйнвар 2025 тикшерелде.
- ↑ DeepSeek R1: модель с производительностью o1 от OpenAI. Сравнение с o1, сколько стоит и как использовать API. 28 гыйнвар 2025 тикшерелде.
- ↑ 1 2 3 Запад шокирован китайским интеллектом (2025-01-27). 28 гыйнвар 2025 тикшерелде.
- ↑ «DeepSeek – это победа над сегрегацией человечества»: как китайцы хакнули ИИ-рынок [неопр.]. БИЗНЕС Online. Мөрәҗәгать итү датасы: 28 гыйнвар 2025.
- ↑ Китайская угроза (2025-01-27). 28 гыйнвар 2025 тикшерелде.
- ↑ 暗涌. 揭秘DeepSeek:一个更极致的中国技术理想主义故事. 30 гыйнвар 2025 тикшерелде.
- ↑ Schneider, Jordan. Deepseek: The Quiet Giant Leading China’s AI Race. 29 гыйнвар 2025 тикшерелде.
- ↑ Meta's chief AI scientist says DeepSeek's success shows that 'open source models are surpassing proprietary ones'. 28 гыйнвар 2025 тикшерелде.
- ↑ 1 2 Ksenia Se, Alyona Vert. Topic 10: Inside DeepSeek Models. Turing Post (28 август 2024).
- ↑ Wiggers, Kyle. DeepSeek's new AI model appears to be one of the best 'open' challengers yet | TechCrunch (2024-12-26). 29 гыйнвар 2025 тикшерелде.
- ↑ Guo, Daya, Zhu, Qihao, Yang, Dejian, Xie, Zhenda, Dong, Kai, Zhang, Wentao, Chen, Guanting, Bi, Xiao, Wu, Y., Li, Y. K., Luo, Fuli, Xiong, Yingfei, Liang, Wenfeng. DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence [ингл.] // arXiv.org. — 2024-01-25.
- ↑ 1 2 DeepSeek — очередной квантовый скачок в развитии AI. 28 гыйнвар 2025 тикшерелде.
- ↑ 1 2 Dai, Damai, Deng, Chengqi, Zhao, Chenggang, Xu, R. X., Gao, Huazuo, Chen, Deli, Li, Jiashi, Zeng, Wangding, Yu, Xingkai, Wu, Y., Xie, Zhenda, Li, Y. K., Huang, Panpan, Luo, Fuli, Ruan, Chong, Sui, Zhifang, Liang, Wenfeng. DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models [ингл.] // arXiv.org. — 2024-01-11.
- ↑ Большие языковые модели в 2024 году: полное сравнение (рус.). www.gptunnel.com. Мөрәҗәгать итү датасы: 29 гыйнвар 2025.
- ↑ 1 2 DeepSeek вызвал истерику у Американских ИИ корпораций. 28 гыйнвар 2025 тикшерелде.
- ↑ The Chinese quant fund-turned-AI pioneer, Financial Times (9 June 2024).
- ↑ BFM.ru. Китайская модель ИИ DeepSeek стала лидером по скачиванию в США. 28 гыйнвар 2025 тикшерелде.
- ↑ DeepSeek-AI, Liu, Aixin, Feng, Bei, Xue, Bing, Wang, Bingxuan, Wu, Bochao, Lu, Chengda, Zhao, Chenggang, Deng, Chengqi, Zhang, Chenyu, Ruan и др. DeepSeek-V3 Technical Report [ингл.] // arXiv.org. — 2024-12-27.
- ↑ Erdil, Ege. How has DeepSeek improved the Transformer architecture? (2025-01-17). 29 гыйнвар 2025 тикшерелде.
- ↑ Elizabeth Gibney. China’s cheap, open AI model DeepSeek thrills scientists [ингл.] // Nature. — 2025-01-23. — ISSN 1476-4687. — DOI:10.1038/d41586-025-00229-6.
- ↑ Chowdhury, Hasan KI aus China: Überholt dieses Startup jetzt OpenAI? (нем.). Business Insider (25 гыйнвар 2025).
- ↑ Sharma, Shubham Open-source DeepSeek-R1 uses pure reinforcement learning to match OpenAI o1 — at 95% less cost [неопр.]. VentureBeat (20 гыйнвар 2025).
- ↑ Moris. DeepSeek, по сути взломал один из святых Граалей ИИ. Smart-Lab (27 гыйнвар 2025).
- ↑ 1 2 ИИ-пузырь лопнул: стоимость Nvidia рухнула на $600 млрд за сутки из-за китайского стартапа DeepSeek. 29 гыйнвар 2025 тикшерелде.
- ↑ Рынок криптовалют упал на 7%. Причем тут ИИ-стартап из Китая DeepSeek на NFT.RU (2025-01-27). 29 гыйнвар 2025 тикшерелде.
- ↑ Microsoft и OpenAI расследуют, обучался ли DeepSeek на украденных данных американских компаний в сфере ИИ. 29 гыйнвар 2025 тикшерелде.
- ↑ BFM.ru. DeepSeek заподозрили в краже технологий OpenAI. 29 гыйнвар 2025 тикшерелде.
- ↑ Overclockers.ru: Одна только китайская компания DeepSeek имеет 50 000 санкционных чипов H100. 28 гыйнвар 2025 тикшерелде.
- ↑ Zafar, Ramish. Chinese AI Lab DeepSeek Has 50,000 NVIDIA H100 AI GPUs, Says AI CEO (2025-01-25). 30 гыйнвар 2025 тикшерелде.
- ↑ Times, GB. How many gpus does OpenAI have? - GB Times (2024-09-30). 28 гыйнвар 2025 тикшерелде.
- ↑ Kelsey Vlamis,Katherine Tangalakis-Lippert. How the US may have unintentionally helped create an AI monster in China. AOL (28 гыйнвар 2025).
- ↑ Dario Amodei. Dario Amodei — On DeepSeek and Export Controls (ингл.). darioamodei.com. Мөрәҗәгать итү датасы: 30 гыйнвар 2025.