Jeudi 27 août 2026

Aube.

Les nouvelles du progrès
Original et traduction

Inkling lance un modèle de 975 milliards de paramètres à poids ouverts

Quitter la comparaison

Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.

Original · allemand
Inkling bringt 975-Milliarden-Parameter-Modell mit offenen Gewichten
Traduction · français
Inkling lance un modèle de 975 milliards de paramètres à poids ouverts
Original · allemand
Thinking Machines Lab veröffentlicht Inkling mit 975 Milliarden Parametern.
Traduction · français
Thinking Machines Lab publie Inkling, un modèle de 975 milliards de paramètres.
Original · allemand
Das multimodale Modell verarbeitet Text, Bilder und Audio mit bis zu einer Million Token Kontext.
Traduction · français
Le modèle multimodal traite le texte, les images et l’audio avec jusqu’à un million de tokens de contexte.
Original · allemand
Für den lokalen Betrieb braucht Inkling etwa 600 GByte RAM in NVFP4.
Traduction · français
Pour fonctionner en local, Inkling a besoin d’environ 600 GByte de RAM en NVFP4.
Original · allemand

Auf dem Papier ist Inkling ein Schwergewicht: Thinking Machines Lab hat sein erstes großes Sprachmodell vorgestellt und die Gewichte veröffentlicht. 975 Milliarden Parameter machen es zum derzeit größten Open-Weight-Modell außerhalb Chinas, das in der Quelle genannt wird. Gegründet wurde das US-Start-up von Mira Murati, der früheren Technikchefin von OpenAI.

Traduction · français

Sur le papier, Inkling est un poids lourd : Thinking Machines Lab a présenté son premier grand modèle de langage et en a publié les poids. Avec 975 milliards de paramètres, il devient le plus grand modèle à poids ouverts actuellement mentionné dans la source, en dehors de Chine. La start-up américaine a été fondée par Mira Murati, l’ancienne directrice technique d’OpenAI.

Original · allemand

Die offene Bereitstellung bedeutet allerdings nicht, dass das Modell auf jedem Rechner läuft. In der kompakten NVFP4-Quantisierung braucht Inkling allein für seine Parameter etwa 600 GByte RAM, im bfloat16-Format sogar 2 TByte. Für viele Nutzer bleibt ein lokaler Betrieb damit außer Reichweite. Die Gewichte sind verfügbar, die nötige Hardware ist es nicht automatisch.

Traduction · français

La mise à disposition ouverte ne signifie toutefois pas que le modèle fonctionnera sur n’importe quel ordinateur. Dans sa quantification compacte NVFP4, Inkling nécessite à lui seul environ 600 GByte de RAM pour ses paramètres, et même 2 TByte au format bfloat16. Pour de nombreux utilisateurs, son fonctionnement en local reste donc hors de portée. Les poids sont disponibles, mais le matériel nécessaire ne l’est pas automatiquement.

Original · allemand

Technisch setzt Inkling auf ein MoE-System, also auf viele spezialisierte Teilmodelle, von denen jeweils nur ein Teil rechnet. Von 256 Experten sind pro Vorhersage sechs aktiv; zwei geteilte Experten arbeiten immer mit. So werden bei jeder Berechnung 41 Milliarden Parameter eingesetzt. Hinzu kommen Text-, Bild- und Audioverarbeitung sowie eine Kontextlänge von einer Million Token.

Traduction · français

Sur le plan technique, Inkling repose sur un système MoE, c’est-à-dire sur de nombreux sous-modèles spécialisés, dont seule une partie effectue les calculs à chaque fois. Parmi les 256 experts, six sont actifs pour chaque prédiction ; deux experts partagés travaillent en permanence. Ainsi, 41 milliards de paramètres sont mobilisés à chaque calcul. Le modèle prend également en charge le texte, les images et l’audio, avec une fenêtre de contexte d’un million de tokens.

Original · allemand

Für Entwickler gibt es zwei konkrete Ansatzpunkte: Inkling kann auf der Plattform Tinker mit eigenen Daten nachtrainiert werden, und ein kleineres Modell übernimmt die Multi-Token Prediction. Es sagt weitere Token voraus, die das große Modell anschließend prüfen kann. Laut Thinking Machines Lab könnte das die Ausgabe beschleunigen und die durchschnittlich benötigte Parameterzahl senken. Ob diese Rechnung trägt, ist noch nicht unabhängig bestätigt.

Traduction · français

Pour les développeurs, deux pistes concrètes se dessinent : Inkling peut être réentraîné avec ses propres données sur la plateforme Tinker, tandis qu’un modèle plus petit prend en charge la prédiction multi-token. Il prédit les tokens suivants, que le grand modèle peut ensuite vérifier. Selon Thinking Machines Lab, cela pourrait accélérer la génération et réduire le nombre moyen de paramètres nécessaires. Il n’est toutefois pas encore confirmé de manière indépendante que ce calcul soit exact.

Original · allemand

Und was ändert das konkret? Teams erhalten ein sehr großes, offen gewichtetes US-Modell, das sie untersuchen und mit eigenen Daten anpassen können, ohne auf ein geschlossenes Modell beschränkt zu sein. Für den Betrieb vor Ort braucht es jedoch eine entsprechend große Speicher- und Rechenumgebung. Der Fortschritt liegt damit zunächst vor allem im Zugang zu den Gewichten und in der Modellarchitektur — nicht in einem unkomplizierten Einsatz auf dem eigenen Rechner.

Traduction · français

Et concrètement, qu’est-ce que cela change ? Les équipes disposent d’un très grand modèle américain à poids ouverts, qu’elles peuvent étudier et adapter avec leurs propres données, sans être limitées à un modèle fermé. Pour l’exploiter sur site, il faut cependant un environnement de stockage et de calcul à la hauteur. Le progrès réside donc pour l’instant surtout dans l’accès aux poids et dans l’architecture du modèle — pas dans une utilisation simple sur son propre ordinateur.

Revenir à l’article