Qwen 3.8 Flash réduit les coûts à un tiers de DeepSeek-V4-Flash

iconMetaEra
Partager
AI summary iconRésumé
Qwen 3.8 Flash d'Alibaba, désormais disponible sur la plateforme Qwen Office, offre 125B MoE avec 6B paramètres actifs par jeton. Il prend en charge nativement 262 144 jetons et fonctionne sur des GPU 4090. Prix : 0,8 RMB par million de jetons d'entrée, soit un tiers du coût de DeepSeek-V4-Flash. Les traders suivant les altcoins à surveiller pourraient trouver ce développement clé. Le modèle gère des tâches complexes en moins de quatre minutes et est prêt pour l'API. Le même jour, Zhipu a open-sourcé GLM-5.3-Flash, au prix du quarantième de Claude Opus 4.8. Le sentiment du marché, y compris l'indice de peur et de cupidité, pourrait évoluer avec l'arrivée de tels modèles à coût réduit.
Alibaba a publié et open-sourcé le modèle Qwen 3.8 Flash, qui utilise une architecture MoE de 125B, activant uniquement environ 6B de paramètres par token, avec une prise en charge native de 262144 tokens de contexte, extensible à 1M tokens via YaRN. L'innovation du modèle réside dans sa capacité à fonctionner sur une carte graphique grand public 4090, permettant ainsi la migration de modèles de texte long de niveau centre de données vers du matériel grand public. Son prix est encore plus compétitif : 0,8 yuan pour un million de tokens en entrée et 2,7 yuan en sortie, soit un tiers du prix de DeepSeek-V4-Flash. Des tests réels montrent que le modèle peut rédiger des textes pour quatre plateformes en 2 minutes, et extraire des comptes rendus de réunions, organiser des tableaux et générer des e-mails en 4 minutes. Qwen 3.8 Flash est désormais disponible sur la plateforme Qwen Office, avec une API simultanément ouverte. Le même jour, Zhipu a open-sourcé GLM-5.3-Flash, dont les performances sont comparables à celles de Claude Opus 4.8, à un prix d'un quarantième.

Auteur et source de l'article : Quantum Bit

Le nouveau modèle d'Ali Baba Qwen soulève la barre à un nouveau niveau.

Ils ont publié et mis en open source Qwen 3.8 Flash-Next, qui non seulement bat directement DeepSeek-V4-Flash en prix, mais a également atteint la première place sur Huggingface dès son lancement !

Image

Les utilisateurs de Twitter sont également en délire, et certains ingénieurs ont même partagé des vidéos de tests réels en s'exclamant :

Qwen 3.8 Flash abaisse le seuil de la VRAM,le modèle de langage à long texte de niveau centre de données peut désormais fonctionner sur une carte graphique grand public 4090 !

Image

Certains l'ont déjà utilisé avec enthousiasme dans leur travail.

En moins de 8 minutes, il a accompli l'ensemble du flux de travail couvrant la programmation Python, l'analyse de plusieurs tableaux et la génération de rapports d'étude :

Image

Les effets de pagode ne posent aucun problème :

Image

Wow, is it really that cool? We definitely have to give it a try too.

Image

Seulement 0,8 yuan pour un million de tokens en entrée

Qwen3.8-Flash utilise une architecture MoE de 125B, activant environ 6B paramètres par token, prend en charge nativement un contexte de 262144 tokens et peut être étendu jusqu'à 1M tokens via YaRN.

En même temps, il s'agit d'une prévisualisation de la nouvelle architecture de Qwen4.

Par rapport à Qwen 3.7 Plus, Qwen 3.8 Flash réduit non seulement les paramètres activés à un tiers, mais ses coûts d'entraînement ne représentent que 1/9, tout en offrant des capacités plus puissantes en matière générale, de raisonnement mathématique et de programmation.

Ce qui est encore plus frappant, c’est le prix : seulement 0,8 yuan pour 1 million de tokens en entrée pour Qwen 3.8 Flash, 2,7 yuan en sortie, et 0,1 yuan pour un hit de cache, soit un prix minimum équivalent à un tiers de celui de DeepSeek-V4-Flash.

C'est bien plus fort que les réductions sur Pinduoduo (bon, en fait)

Image

D'accord, puisque le prix est déjà à ce niveau, on n'hésite plus : on passe directement à l'action avec deux tests concrets pour évaluer les capacités réelles de Qwen 3.8 Flash dans des scénarios professionnels.

Test réel 1 : Concevoir quatre textes adaptés à différentes plateformes pour un produit caméra

Nous avons organisé un « défi d'écriture de contenu » où Qwen 3.8 Flash doit réécrire un document de près de dix mille caractères sur un appareil photo en textes adaptés à Xiaohongshu, Weibo, Douyin et WeChat Moments, avec un budget de 1 yuan, pour voir combien de tâches il peut accomplir.

Les instructions sont les suivantes :

Image

Après avoir envoyé le prompt, je suis allé à la cuisine de l'entreprise me servir un verre d'eau, en moins de deux minutes au total.

En revenant, j’ai constaté que les quatre textes pour différentes plateformes étaient déjà tous rédigés, et les marques, le style et les hashtags étaient parfaitement ciblés (sauf que je n’aurais pas posté un tel long message sur mon朋友圈, hhh) :

Image

Image

Image

Image

En moins de deux minutes, j'ai terminé quatre textes — la vitesse du « travailleur cybernétique » est à la hauteur.

Mais ce qui cause vraiment des soucis au travail, ce n'est souvent pas la rédaction de contenus, mais qui va ramasser les morceaux après une réunion.

Nous lui avons donc attribué un deuxième travail pour tester ses compétences pratiques en milieu professionnel.

Test pratique 2 : Transformer une réunion produit hebdomadaire en un plan exécutable

Nous avons reconstitué fidèlement un document de transcription de réunion de dix mille mots, tel qu’on pourrait le recevoir juste après une réunion hebdomadaire — rempli de fautes d’orthographe phonétiques et de conversations anecdotiques — sous le thème « Réunion d’évaluation des exigences et techniques de l’Agent de service client intelligent V2.0 », et avons demandé à Qwen3.8-Flash d’effectuer en une seule fois l’extraction des résumés, la mise en forme de tableaux et la rédaction de l’e-mail de notification post-réunion.

Image△ L'image a été générée par IA, entendre « token » comme «偷啃» est vraiment très vivant.

Les instructions sont les suivantes :

Image

En mode par défaut, Qwen3.8-Flash a accompli toutes les tâches en moins de 4 minutes, avec des résumés précis des cinq conclusions clés, une répartition exacte des tâches dans le tableau, un format d’e-mail conforme et des destinataires correspondant exactement au contenu de la réunion.

Image

Image

Image

Image△ Certaines images de résultats de test

Même sans y être invité, il nous a spontanément organisé les points non résolus de la réunion, pour faciliter notre prochaine discussion :

Image

Et à ce stade, je n’ai pas encore épuisé mon quota !

Ahaha, se sentir aussi libre est vraiment génial.

Qwen 3.8 Flash est désormais disponible en exclusivité sur la plateforme « Qianwen Office », et ses API sont également ouvertes — n'hésitez pas à les tester !

Image

Une dernière chose

La guerre des prix entre les grands modèles nationaux s’intensifie.

Presque en même temps que l'ouverture de Qwen 3.8 Flash, Zhipu a également ouvert GLM-5.3-Flash, le premier modèle multimodal natif de la série GLM-5, également connu sous le nom d'Ox Alpha, le modèle "Niu Lai" qui a connu un grand succès en ligne.

Lors de l'évaluation, les performances de ce modèle sont comparables à celles de Claude Opus 4.8, mais son prix a été réduit à un dixième de celui de GLM-5.3.

Image

De plus, GLM-5.3-Flash propose généreusement une promotion à moitié prix pendant deux semaines, ce qui signifie que le prix de GLM-5.3-Flash pendant la période de promotion est uniquement 1/20 de celui de GLM-5.3 et 1/40 de celui d'Opus4.8.

Image

De plus, Qwen 3.8 Flash et GLM-5.3-Flash ont un autre point commun : ils ont tous deux pris DeepSeek-V4-Flash au dépourvu avec un prix extrêmement bas (DeepSeek s'éloigne en marmonnant) :

Image△ Comparaison des prix de DeepSeek-V4-Flash, Qwen 3.8 Flash et GLM-5.3-Flash

Pas de doute, c'est trop concurrentiel.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.