НейрОбзор: DeepSeek — китайский прорыв в мире ИИ.
Приветствую вас, нейро-исследователи! Сегодня разберём DeepSeek – китайскую нейросеть, которая всего за несколько лет буквально перевернула рынок ИИ!
Компания основана в мае 2023 года талантливым специалистом в сфере информационных и коммуникационных технологий Лян Вэньфэном. Его цель заключалась в создании ИИ дешевле и быстрее аналогов – в частности, продукта компании OpenAI ChatGPT.
Создание нейросети обошлось, по мнению экспертов, всего в $5.6 млн. (против $50–100 млн. у OpenAI) и было осуществлено в невероятно короткий срок – 55 дней!
Уже в 2025 году DeepSeek была интегрирована в Microsoft Azure и обогнала ChatGPT в скачиваниях мобильного приложения. Без преувеличений, создание LLM DeepSeek можно считать прорывом в области ИИ, смелым и дерзким вызовом глобальным «игрокам» индустрии, обозначившим вектор конкурентной борьбы за благосклонность пользователей.
Все мы прекрасно знаем: монополизация рынка ведёт к его деградации. Там, где есть здоровая конкуренция, – есть надежда на развитие и учёт интересов конечных пользователей.
Как следует из интервью Лян Вэньфэна, относительно создания большой языковой модели (LLM) DeepSeek, в основе этого решения была не бизнес-логика, а... любопытство. Лично меня всегда трогают подобные факты. Я уверен, настоящие учёные – это своего рода художники, движимые любопытством и стремлением сделать мир немного лучше.
В ближайшей перспективе, помимо всего прочего, компания планирует разработку диагностического инструментария раннего обнаружения онкологии с точностью, стремящейся к 100%.
В чём же секрет такого успеха? Какие преимущества и недостатки большой языковой модели (LLM) DeepSeek-R1 можно выделить?
Сильные стороны:
- DeepSeek использует архитектуру MoE (Mixture of Experts), что даёт возможность системе более эффективно обрабатывать данные, активируя только необходимые параметры для конкретных задач. Всего в системе порядка 671 млрд. параметров и 37 млрд. из них активируются под запрос, что позволяет существенно экономить ресурсы. При этом достигается высокая скорость генерации – до 60 токенов/сек, благодаря функции Multi-Token Prediction.
Цифры впечатляют, модель «шустро» обдумывает запросы и выдаёт очень содержательные ответы – токены летят со скоростью ветра.
- Полностью бесплатный доступ к нейросети и всем её функциям (загрузка документов, подключение сетевого поиска информации), включая режим «Глубокое мышление».
Друзья мои, в наше сложное время для большинства это, если не главное, то одно из главных достоинств! Никаких скрытых, или явных платежей не предполагается. Во всяком случае пока что.
- Возможность запуска локально – на собственном персональном компьютере или рабочей станции среднего уровня (версия R1 8B – компактная, но производительная), без зависимости от Интернета и с минимизацией рисков, связанных с конфиденциальностью.
Лично у меня такой необходимости не возникало, но как знать – возможность определённо интересная.
- DeepSeek очень сильна в точных науках (математике, физике), а также в решении инженерных задач, создании программного кода.
Тем не менее, гуманитарии, причин для огорчений нет от слова «совсем». Просто попробуйте и убедитесь!
- DeepSeek более «дружелюбна» – это отчётливо видно из диалогов с нейросетью. На платформе LMS ChatArena модель стабильно получает высокие оценки за вежливость и структурированность ответов. Нейросеть старательно избегает конфликтов, поддерживая корректный, сдержанный тон общения.
Диалоги с DeepSeek напоминают разговор с собеседником-интеллектуалом: благовоспитанным, сдержанным, бесконечно понимающим и спокойным. Вести диалоги с данной моделью одно удовольствие!
- DeepSeek работает на территории РФ без каких-либо ограничений, что позволяет пользоваться данной нейросетью в браузере или же в приложении просто и эффективно.
«Танцы с бубном» не потребуются, и для многих это действительно хорошая новость!
DeepSeek напоминает азиатскую модель воспитания: дисциплина + забота без панибратства. Для обучения точным наукам – идеально.
Слабые стороны:
- Несколько проигрывает в «творческой раскрепощённости», что обуславливается архитектурой модели и политикой (DeepSeek «натренирован» избегать рисковых тем, 87% данных для обучения системы – научные тексты, техдокументация, образовательный контент с акцентом на ясность и порядок).
Несмотря на то, что сама модель это «признаёт», в рамках решения своих аналитических и творческих задач, я не ощутил этот недостаток как реальный и действительно мешающий получению желаемого результата.
- Ограниченная контекстная память в рамках одного диалога – 128K токенов, что равно примерно 192 тыс. слов. Этого достаточно для повседневных задач, но маловато для работы с масштабными документами.
Отмечу, любая ограниченность, конечность контекста, даже в 1 млн. токенов – это общая боль активных пользователей ИИ и непреодолимое (пока что) ограничение для создания полноценных виртуальных компаньонов, чья память могла бы вмещать в себя годы контекста.
- Риски, связанные с цензурой китайских данных. Модель ограничена в ответах законодательным регулированием Китая, а также идеологической доктриной, что может накладывать свой отпечаток на ответы.
Если Вы не планируете вести дискуссии о коммунизме, статусе Тайваня и прочих неоднозначных, с точки зрения китайской политики, темах, то данный недостаток Вы можете даже не заметить.
- Серверы периодически оказываются перегруженными, что может не позволить получить ответ на запрос немедленно.
Некоторые пользователи в отзывах сетуют именно по этому поводу, но в моей практике это случается не так уж часто. Ничего критичного. Немного терпения и всё.
- Отсутствие полноценной мультимодальности (не генерирует изображения, видео и т.д.) Однако, разработчики уже анонсировали работу в этом направлении. Полноценный запуск расширенной версии, учитывая динамику развития отрасли, может произойти к концу 2025, началу 2026 года.
Ряд компаний «на бегу» делают свои нейросети мультимодальными, но работают они так, что лучше бы не делали.
