Both versions are aligned block by block, in reading order: title, the essentials, then paragraph by paragraph. Where the translation merged or split a paragraph, the matching cell stays empty — we never pair two passages by guesswork.
Auf dem Papier ist Inkling ein Schwergewicht: Thinking Machines Lab hat sein erstes großes Sprachmodell vorgestellt und die Gewichte veröffentlicht. 975 Milliarden Parameter machen es zum derzeit größten Open-Weight-Modell außerhalb Chinas, das in der Quelle genannt wird. Gegründet wurde das US-Start-up von Mira Murati, der früheren Technikchefin von OpenAI.
On paper, Inkling is a heavyweight: Thinking Machines Lab has unveiled its first large language model and released its weights. With 975 billion parameters, it is the largest open-weight model outside China mentioned in the source. The US start-up was founded by Mira Murati, OpenAI's former chief technology officer.
Die offene Bereitstellung bedeutet allerdings nicht, dass das Modell auf jedem Rechner läuft. In der kompakten NVFP4-Quantisierung braucht Inkling allein für seine Parameter etwa 600 GByte RAM, im bfloat16-Format sogar 2 TByte. Für viele Nutzer bleibt ein lokaler Betrieb damit außer Reichweite. Die Gewichte sind verfügbar, die nötige Hardware ist es nicht automatisch.
However, making the weights available does not mean the model will run on every computer. In the compact NVFP4 quantization, Inkling requires around 600 GB of RAM for its parameters alone, and as much as 2 TB in bfloat16 format. That puts local operation out of reach for many users. The weights are available, but the required hardware is not automatically available as well.
Technisch setzt Inkling auf ein MoE-System, also auf viele spezialisierte Teilmodelle, von denen jeweils nur ein Teil rechnet. Von 256 Experten sind pro Vorhersage sechs aktiv; zwei geteilte Experten arbeiten immer mit. So werden bei jeder Berechnung 41 Milliarden Parameter eingesetzt. Hinzu kommen Text-, Bild- und Audioverarbeitung sowie eine Kontextlänge von einer Million Token.
Technically, Inkling uses an MoE system, meaning many specialized submodels, only some of which perform computations at any given time. Of 256 experts, six are active for each prediction; two shared experts always work alongside them. This means 41 billion parameters are used in each calculation. Text, image and audio processing are also included, as is a context length of one million tokens.
Für Entwickler gibt es zwei konkrete Ansatzpunkte: Inkling kann auf der Plattform Tinker mit eigenen Daten nachtrainiert werden, und ein kleineres Modell übernimmt die Multi-Token Prediction. Es sagt weitere Token voraus, die das große Modell anschließend prüfen kann. Laut Thinking Machines Lab könnte das die Ausgabe beschleunigen und die durchschnittlich benötigte Parameterzahl senken. Ob diese Rechnung trägt, ist noch nicht unabhängig bestätigt.
Developers have two specific options: Inkling can be further trained on their own data on the Tinker platform, and a smaller model handles Multi-Token Prediction. It predicts additional tokens that the larger model can then check. According to Thinking Machines Lab, this could speed up output and reduce the average number of parameters required. Whether this calculation holds up has not yet been independently confirmed.
Und was ändert das konkret? Teams erhalten ein sehr großes, offen gewichtetes US-Modell, das sie untersuchen und mit eigenen Daten anpassen können, ohne auf ein geschlossenes Modell beschränkt zu sein. Für den Betrieb vor Ort braucht es jedoch eine entsprechend große Speicher- und Rechenumgebung. Der Fortschritt liegt damit zunächst vor allem im Zugang zu den Gewichten und in der Modellarchitektur — nicht in einem unkomplizierten Einsatz auf dem eigenen Rechner.
So what does this change in concrete terms? Teams gain a very large, open-weight US model that they can study and adapt with their own data, without being limited to a closed model. However, running it on-site requires a correspondingly large memory and compute environment. For now, the progress lies primarily in access to the weights and in the model architecture—not in straightforward deployment on one's own computer.