Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
Auf dem Papier ist Inkling ein Schwergewicht: Thinking Machines Lab hat sein erstes großes Sprachmodell vorgestellt und die Gewichte veröffentlicht. 975 Milliarden Parameter machen es zum derzeit größten Open-Weight-Modell außerhalb Chinas, das in der Quelle genannt wird. Gegründet wurde das US-Start-up von Mira Murati, der früheren Technikchefin von OpenAI.
Sur le papier, Inkling est un poids lourd : Thinking Machines Lab a présenté son premier grand modèle de langage et en a publié les poids. Avec 975 milliards de paramètres, il devient le plus grand modèle à poids ouverts actuellement mentionné dans la source, en dehors de Chine. La start-up américaine a été fondée par Mira Murati, l’ancienne directrice technique d’OpenAI.
Die offene Bereitstellung bedeutet allerdings nicht, dass das Modell auf jedem Rechner läuft. In der kompakten NVFP4-Quantisierung braucht Inkling allein für seine Parameter etwa 600 GByte RAM, im bfloat16-Format sogar 2 TByte. Für viele Nutzer bleibt ein lokaler Betrieb damit außer Reichweite. Die Gewichte sind verfügbar, die nötige Hardware ist es nicht automatisch.
La mise à disposition ouverte ne signifie toutefois pas que le modèle fonctionnera sur n’importe quel ordinateur. Dans sa quantification compacte NVFP4, Inkling nécessite à lui seul environ 600 GByte de RAM pour ses paramètres, et même 2 TByte au format bfloat16. Pour de nombreux utilisateurs, son fonctionnement en local reste donc hors de portée. Les poids sont disponibles, mais le matériel nécessaire ne l’est pas automatiquement.
Technisch setzt Inkling auf ein MoE-System, also auf viele spezialisierte Teilmodelle, von denen jeweils nur ein Teil rechnet. Von 256 Experten sind pro Vorhersage sechs aktiv; zwei geteilte Experten arbeiten immer mit. So werden bei jeder Berechnung 41 Milliarden Parameter eingesetzt. Hinzu kommen Text-, Bild- und Audioverarbeitung sowie eine Kontextlänge von einer Million Token.
Sur le plan technique, Inkling repose sur un système MoE, c’est-à-dire sur de nombreux sous-modèles spécialisés, dont seule une partie effectue les calculs à chaque fois. Parmi les 256 experts, six sont actifs pour chaque prédiction ; deux experts partagés travaillent en permanence. Ainsi, 41 milliards de paramètres sont mobilisés à chaque calcul. Le modèle prend également en charge le texte, les images et l’audio, avec une fenêtre de contexte d’un million de tokens.
Für Entwickler gibt es zwei konkrete Ansatzpunkte: Inkling kann auf der Plattform Tinker mit eigenen Daten nachtrainiert werden, und ein kleineres Modell übernimmt die Multi-Token Prediction. Es sagt weitere Token voraus, die das große Modell anschließend prüfen kann. Laut Thinking Machines Lab könnte das die Ausgabe beschleunigen und die durchschnittlich benötigte Parameterzahl senken. Ob diese Rechnung trägt, ist noch nicht unabhängig bestätigt.
Pour les développeurs, deux pistes concrètes se dessinent : Inkling peut être réentraîné avec ses propres données sur la plateforme Tinker, tandis qu’un modèle plus petit prend en charge la prédiction multi-token. Il prédit les tokens suivants, que le grand modèle peut ensuite vérifier. Selon Thinking Machines Lab, cela pourrait accélérer la génération et réduire le nombre moyen de paramètres nécessaires. Il n’est toutefois pas encore confirmé de manière indépendante que ce calcul soit exact.
Und was ändert das konkret? Teams erhalten ein sehr großes, offen gewichtetes US-Modell, das sie untersuchen und mit eigenen Daten anpassen können, ohne auf ein geschlossenes Modell beschränkt zu sein. Für den Betrieb vor Ort braucht es jedoch eine entsprechend große Speicher- und Rechenumgebung. Der Fortschritt liegt damit zunächst vor allem im Zugang zu den Gewichten und in der Modellarchitektur — nicht in einem unkomplizierten Einsatz auf dem eigenen Rechner.
Et concrètement, qu’est-ce que cela change ? Les équipes disposent d’un très grand modèle américain à poids ouverts, qu’elles peuvent étudier et adapter avec leurs propres données, sans être limitées à un modèle fermé. Pour l’exploiter sur site, il faut cependant un environnement de stockage et de calcul à la hauteur. Le progrès réside donc pour l’instant surtout dans l’accès aux poids et dans l’architecture du modèle — pas dans une utilisation simple sur son propre ordinateur.