Au-delà de Deepseek, "l'armée" de l'open source de la Chine remodèle l'écosystème mondial de l'IA

Sina - 27/04
Au-delà de Deepseek, "l'armée" de l'open source de la Chine remodèle l'écosystème mondial de l'IA

La Chine ouvre sa source et forme une force conjointe

Début février, lorsque le modèle open source chinois Deepseek a dépassé le classement de téléchargement du marché des applications dans 140 pays et régions du monde entier, Openai a ouvertement accusé les médias d'utiliser les données de distillation de Chatgpt sans autorisation.

De telles accusations n'ont pas seulement échoué à "retrouver le respect" d'OpenAI, mais ont également attiré le "ridicule de groupe" des praticiens de la recherche scientifique mondiale.

Maintenant, un autre joueur qui a rempli le buff distillé est apparu.

Le 13 avril, Kunlun Wanwei (Rights Protection) a lancé le modèle Skywork-OR1 (Open Reasoner 1), avec des performances dépassant Alibaba QWQ-32B à la même échelle et alignant Deepseek-R1.

Pourquoi Kunlun Wanwei, qui n'a pas une forte force financière, peut-il également faire de grands modèles de niveau Sota? En fait, le fonctionnaire ne le cache pas. Leur modèle est formé sur la base des deux modèles, Deepseek-R1-Distill-Qwen-7B et Deepseek-R1-Distill-Qwen-32B.

Et comme en témoigne le nom, ces deux modèles de Deepseek ont ​​des modèles de série Qwen distillés d'Alibaba.

Tout en tirant parti de l'excellent modèle open source, Kunlun Wanwei apporte également sa propre contribution à la communauté open source. Par rapport à Deepseek, qui n'a que des poids de modèle open source, Kunlun Wanwei a également ouvert les ensembles de données et les codes de formation qu'il utilise, qui est plus proche du concept de "véritable open source". Cela signifie que tout utilisateur peut essayer de reproduire son processus de formation de modèle.

Les réalisations de Kunlun Wanwei démontrent pleinement la signification la plus importante de l'open source - non seulement pour fournir aux utilisateurs un produit gratuit, mais aussi pour permettre à plus de développeurs de se tenir sur les épaules de leurs prédécesseurs et à faible coût pour faire avancer la technologie.

En fait, tout comme l'industrie discutait de la pré-formation des grands modèles l'année dernière, la vitesse d'itération des grands modèles chinois est accélérée depuis cette année, et de plus en plus d'entreprises investissent dans l'open source.

Alibaba Cloud Tongyi Qianwen a commencé à open source le nouveau modèle visuel QWEN2.5-VL le soir du Nouvel An, puis a publié et ouvert le nouveau modèle d'inférence QWQ-32B début mars. Le jour de l'open source, il est en tête de la liste des tendances de HuggingFace, la communauté open source mondiale de l'IA.

L'étape Yuexingchen ouvre la source de trois modèles multimodaux en environ un mois. La dernière open source est le modèle de la vidéo de la vidéo de la video-ti2v. Les vidéos prises en charge pour les fonctionnalités générées ont deux caractéristiques principales: l'amplitude de mouvement contrôlable et le mouvement de l'objectif contrôlable, et ont également certaines capacités de génération d'effets spéciaux.

Zhipu a annoncé le modèle GLM de la série 32b / 9b open source en avril, couvrant l'amarrage, le raisonnement et les modèles contemplatifs, tous suivant l'accord de licence du MIT.

Même Baidu, qui était autrefois fermé, a annoncé qu'il ouvrirait complètement le modèle Wenxin le 30 juin.

Par rapport à la prospérité croissante de l'écosystème open source national, les sociétés américaines de grandes modèles sont toujours principalement basées sur une source fermée, ce qui offre également une rare opportunité pour le grand modèle chinois à l'étranger. Deepseek permet à la société d'éducation indonésienne Ruangguru d'optimiser les modèles d'enseignement à faible coût; La société de technologies touristiques B2B de Singapou...
[Courte citation de 8% de l'article original]

Loading...