Thursday, 27 August 2026

Aube.

News of progress
Original and translation

Inkling brings a 975-billion-parameter model with open weights

Leave comparison

Both versions are aligned block by block, in reading order: title, the essentials, then paragraph by paragraph. Where the translation merged or split a paragraph, the matching cell stays empty — we never pair two passages by guesswork.

Original · German
Inkling bringt 975-Milliarden-Parameter-Modell mit offenen Gewichten
Translation · English
Inkling brings a 975-billion-parameter model with open weights
Original · German
Thinking Machines Lab veröffentlicht Inkling mit 975 Milliarden Parametern.
Translation · English
Thinking Machines Lab releases Inkling with 975 billion parameters.
Original · German
Das multimodale Modell verarbeitet Text, Bilder und Audio mit bis zu einer Million Token Kontext.
Translation · English
The multimodal model processes text, images and audio with up to one million tokens of context.
Original · German
Für den lokalen Betrieb braucht Inkling etwa 600 GByte RAM in NVFP4.
Translation · English
For local operation, Inkling requires around 600 GB of RAM in NVFP4.
Original · German

Auf dem Papier ist Inkling ein Schwergewicht: Thinking Machines Lab hat sein erstes großes Sprachmodell vorgestellt und die Gewichte veröffentlicht. 975 Milliarden Parameter machen es zum derzeit größten Open-Weight-Modell außerhalb Chinas, das in der Quelle genannt wird. Gegründet wurde das US-Start-up von Mira Murati, der früheren Technikchefin von OpenAI.

Translation · English

On paper, Inkling is a heavyweight: Thinking Machines Lab has unveiled its first large language model and released its weights. With 975 billion parameters, it is the largest open-weight model outside China mentioned in the source. The US start-up was founded by Mira Murati, OpenAI's former chief technology officer.

Original · German

Die offene Bereitstellung bedeutet allerdings nicht, dass das Modell auf jedem Rechner läuft. In der kompakten NVFP4-Quantisierung braucht Inkling allein für seine Parameter etwa 600 GByte RAM, im bfloat16-Format sogar 2 TByte. Für viele Nutzer bleibt ein lokaler Betrieb damit außer Reichweite. Die Gewichte sind verfügbar, die nötige Hardware ist es nicht automatisch.

Translation · English

However, making the weights available does not mean the model will run on every computer. In the compact NVFP4 quantization, Inkling requires around 600 GB of RAM for its parameters alone, and as much as 2 TB in bfloat16 format. That puts local operation out of reach for many users. The weights are available, but the required hardware is not automatically available as well.

Original · German

Technisch setzt Inkling auf ein MoE-System, also auf viele spezialisierte Teilmodelle, von denen jeweils nur ein Teil rechnet. Von 256 Experten sind pro Vorhersage sechs aktiv; zwei geteilte Experten arbeiten immer mit. So werden bei jeder Berechnung 41 Milliarden Parameter eingesetzt. Hinzu kommen Text-, Bild- und Audioverarbeitung sowie eine Kontextlänge von einer Million Token.

Translation · English

Technically, Inkling uses an MoE system, meaning many specialized submodels, only some of which perform computations at any given time. Of 256 experts, six are active for each prediction; two shared experts always work alongside them. This means 41 billion parameters are used in each calculation. Text, image and audio processing are also included, as is a context length of one million tokens.

Original · German

Für Entwickler gibt es zwei konkrete Ansatzpunkte: Inkling kann auf der Plattform Tinker mit eigenen Daten nachtrainiert werden, und ein kleineres Modell übernimmt die Multi-Token Prediction. Es sagt weitere Token voraus, die das große Modell anschließend prüfen kann. Laut Thinking Machines Lab könnte das die Ausgabe beschleunigen und die durchschnittlich benötigte Parameterzahl senken. Ob diese Rechnung trägt, ist noch nicht unabhängig bestätigt.

Translation · English

Developers have two specific options: Inkling can be further trained on their own data on the Tinker platform, and a smaller model handles Multi-Token Prediction. It predicts additional tokens that the larger model can then check. According to Thinking Machines Lab, this could speed up output and reduce the average number of parameters required. Whether this calculation holds up has not yet been independently confirmed.

Original · German

Und was ändert das konkret? Teams erhalten ein sehr großes, offen gewichtetes US-Modell, das sie untersuchen und mit eigenen Daten anpassen können, ohne auf ein geschlossenes Modell beschränkt zu sein. Für den Betrieb vor Ort braucht es jedoch eine entsprechend große Speicher- und Rechenumgebung. Der Fortschritt liegt damit zunächst vor allem im Zugang zu den Gewichten und in der Modellarchitektur — nicht in einem unkomplizierten Einsatz auf dem eigenen Rechner.

Translation · English

So what does this change in concrete terms? Teams gain a very large, open-weight US model that they can study and adapt with their own data, without being limited to a closed model. However, running it on-site requires a correspondingly large memory and compute environment. For now, the progress lies primarily in access to the weights and in the model architecture—not in straightforward deployment on one's own computer.

Back to the article