Qu'est-ce que DeepSeek, le concurrent de ChatGPT ? Comment utiliser DeepSeek ?

Le domaine de l'intelligence artificielle connaît chaque jour des avancées nouvelles et passionnantes. Récemment, c'est l'entreprise chinoise DeepSeek qui a attiré toute l'attention. Alors, qu'est-ce que DeepSeek exactement et comment l'utiliser ?

12punto

L'intelligence artificielle influence profondément la technologie de demain et d'aujourd'hui. Dans le monde de l'IA, le nom qui fait le plus parler de lui ces derniers temps est le chinois DeepSeek. Alors, qu'est-ce que DeepSeek ? Comment utiliser DeepSeek ?

QU'EST-CE QUE DEEPSEEK ?

DeepSeek est un laboratoire de recherche en intelligence artificielle basé en Chine, spécialisé dans le développement de grands modèles de langage (LLM) open source. L'entreprise a été fondée en 2023 par Liang Wenfeng, fondateur et gestionnaire du fonds spéculatif High-Flyer, dans le but de faire progresser les travaux dans le domaine de l'IA. Auparavant, High-Flyer était connu pour le développement d'algorithmes de trading basés sur l'intelligence artificielle.

DeepSeek Coder (novembre 2023) : Ce modèle, ciblant spécifiquement les tâches de codage, a été mis à disposition gratuitement tant pour les chercheurs que pour les utilisateurs commerciaux. Le modèle a été publié en open source sous licence MIT.

LES MODÈLES DÉVELOPPÉS

DeepSeek LLM (novembre 2023) : Doté de 67 milliards de paramètres, ce modèle a été conçu pour rivaliser avec les grands modèles de langage tels que GPT-4. Cependant, il a rencontré certaines difficultés en termes d'efficacité de calcul et d'évolutivité. La version chatbot du modèle, DeepSeek Chat, a également été lancée à la même période.

DeepSeek-V2 (mai 2024) : Lancé à un coût inférieur à celui de ses concurrents (2 RMB par million de jetons de sortie), ce modèle s'est classé septième dans le classement du Tiger Lab de l'Université de Waterloo.

DeepSeek-V3 (décembre 2024) : Avec 671 milliards de paramètres, ce modèle a été entraîné pendant environ 55 jours sur un ensemble de données massif de 14,8 billions de jetons. Le coût total du processus d'entraînement est de 5,58 millions de dollars américains. Grâce à ses performances, le modèle a surpassé Llama 3.1 et Qwen 2.5, atteignant un niveau équivalent à GPT-4o et Claude 3.5 Sonnet.

DeepSeek R1-Lite-Preview (novembre 2024) : Ce modèle est spécialisé dans l'inférence logique, le raisonnement mathématique et la résolution de problèmes en temps réel. Il a affiché des performances similaires au modèle o1 d'OpenAI.