Les deux versions sont alignées bloc par bloc, dans l’ordre du texte : titre, l’essentiel, puis paragraphe par paragraphe. Quand la traduction a fusionné ou scindé un paragraphe, la case correspondante reste vide — on ne rapproche jamais deux passages au jugé.
At EPFL's Laboratory of Artificial Chemical Intelligence, Bojana Ranković and Philippe Schwaller tested GOLLuM with a narrow budget: 50 experiments to search for strong chemical, materials and molecular conditions. In that evaluation, 36.3% of the conditions it tried landed in the top 5% of all possible outcomes, while the method matched traditional optimization using over 40% fewer experiments.
Au Laboratoire d’intelligence artificielle chimique de l’EPFL, Bojana Ranković et Philippe Schwaller ont testé GOLLuM avec un budget limité : 50 expériences pour rechercher des conditions chimiques, matérielles et moléculaires performantes. Lors de cette évaluation, 36,3 % des conditions qu’il a essayées se sont classées dans les 5 % supérieurs de tous les résultats possibles, tandis que la méthode a égalé l’optimisation traditionnelle avec plus de 40 % d’expériences en moins.
Scientists already use Bayesian optimization to decide which experiment to run next. It learns from past results, predicts promising options and estimates uncertainty, helping teams avoid spending time and money on weak candidates. The problem is portability: a model that chooses chemical reactions efficiently may not fit materials or molecular design. Large language models carry broad scientific knowledge, but their confidence is a poor guide to whether a suggestion is correct.
Les scientifiques utilisent déjà l’optimisation bayésienne pour décider quelle expérience mener ensuite. Celle-ci apprend des résultats passés, prédit les options prometteuses et estime l’incertitude, ce qui aide les équipes à éviter de consacrer du temps et de l’argent à des candidats peu performants. Le problème est la transférabilité : un modèle qui sélectionne efficacement les réactions chimiques peut ne pas convenir aux matériaux ou à la conception moléculaire. Les grands modèles de langage disposent de vastes connaissances scientifiques, mais leur niveau de confiance indique mal si une suggestion est correcte.
GOLLuM adds a Gaussian process — a probabilistic model used to score performance and uncertainty — as a built-in doubt detector. The large language model is not asked to choose experiments on its own; instead, it learns from the Gaussian process's scores. As results accumulate, the system reorganizes its search space so conditions that behave alike sit closer together, while conditions with different results move apart. The method works directly from a plain-English description of the experimental procedure.
GOLLuM ajoute un processus gaussien — un modèle probabiliste utilisé pour évaluer la performance et l’incertitude — qui sert de détecteur de doute intégré. Il n’est pas demandé au grand modèle de langage de choisir seul les expériences ; il apprend à la place à partir des scores du processus gaussien. À mesure que les résultats s’accumulent, le système réorganise son espace de recherche afin que les conditions qui se comportent de la même manière soient plus proches, tandis que celles qui produisent des résultats différents s’éloignent. La méthode fonctionne directement à partir d’une description en anglais courant de la procédure expérimentale.
The researchers evaluated GOLLuM on 23 benchmark tasks spanning organic synthesis, analytical and process chemistry, materials, catalysis and molecular property optimization. Every run began with 10 low-performing observations, and the team used the same configuration across the tasks rather than tuning it separately. GOLLuM ranked first on average and beat Bayesian optimization with expert-designed descriptors on the reported measures. By contrast, direct prompting produced failure rates from 10% to around 80%, including invented chemical structures, repeated conditions and suggestions outside the permitted search space.
Les chercheurs ont évalué GOLLuM sur 23 tâches de référence couvrant la synthèse organique, la chimie analytique et la chimie des procédés, les matériaux, la catalyse et l’optimisation des propriétés moléculaires. Chaque série a commencé avec 10 observations peu performantes, et l’équipe a utilisé la même configuration pour toutes les tâches au lieu de l’ajuster séparément. GOLLuM s’est classé premier en moyenne et a devancé l’optimisation bayésienne reposant sur des descripteurs conçus par des experts selon les mesures rapportées. À l’inverse, les invites directes ont produit des taux d’échec allant de 10 % à environ 80 %, notamment des structures chimiques inventées, des conditions répétées et des suggestions en dehors de l’espace de recherche autorisé.
And so, concretely: research teams could use a language model's broad scientific representations without trusting its answers alone, potentially testing promising recipes with fewer laboratory runs.
Concrètement : les équipes de recherche pourraient exploiter les vastes représentations scientifiques d’un modèle de langage sans se fier à ses seules réponses, et tester potentiellement des recettes prometteuses avec moins d’expériences en laboratoire.