Le due versioni sono allineate blocco per blocco, nell’ordine del testo: titolo, l’essenziale, poi paragrafo per paragrafo. Quando la traduzione ha fuso o diviso un paragrafo, la casella corrispondente resta vuota — non accostiamo mai due passaggi a occhio.
At EPFL's Laboratory of Artificial Chemical Intelligence, Bojana Ranković and Philippe Schwaller tested GOLLuM with a narrow budget: 50 experiments to search for strong chemical, materials and molecular conditions. In that evaluation, 36.3% of the conditions it tried landed in the top 5% of all possible outcomes, while the method matched traditional optimization using over 40% fewer experiments.
Nel Laboratory of Artificial Chemical Intelligence di EPFL, Bojana Ranković e Philippe Schwaller hanno testato GOLLuM con un budget limitato: 50 esperimenti per cercare condizioni efficaci in ambito chimico, dei materiali e molecolare. In questa valutazione, il 36,3% delle condizioni provate è rientrato nel 5% di tutti i risultati possibili, mentre il metodo ha raggiunto le stesse prestazioni dell'ottimizzazione tradizionale usando oltre il 40% di esperimenti in meno.
Scientists already use Bayesian optimization to decide which experiment to run next. It learns from past results, predicts promising options and estimates uncertainty, helping teams avoid spending time and money on weak candidates. The problem is portability: a model that chooses chemical reactions efficiently may not fit materials or molecular design. Large language models carry broad scientific knowledge, but their confidence is a poor guide to whether a suggestion is correct.
Gli scienziati usano già l'ottimizzazione bayesiana per decidere quale esperimento eseguire successivamente. Il metodo apprende dai risultati passati, prevede le opzioni promettenti e stima l'incertezza, aiutando i team a evitare di spendere tempo e denaro per candidati poco efficaci. Il problema è la trasferibilità: un modello che seleziona in modo efficiente le reazioni chimiche potrebbe non essere adatto ai materiali o alla progettazione molecolare. I modelli linguistici di grandi dimensioni possiedono ampie conoscenze scientifiche, ma il loro livello di sicurezza è una guida poco affidabile per stabilire se un suggerimento sia corretto.
GOLLuM adds a Gaussian process — a probabilistic model used to score performance and uncertainty — as a built-in doubt detector. The large language model is not asked to choose experiments on its own; instead, it learns from the Gaussian process's scores. As results accumulate, the system reorganizes its search space so conditions that behave alike sit closer together, while conditions with different results move apart. The method works directly from a plain-English description of the experimental procedure.
GOLLuM aggiunge un processo gaussiano — un modello probabilistico usato per valutare prestazioni e incertezza — come rilevatore integrato dei dubbi. Al modello linguistico di grandi dimensioni non viene chiesto di scegliere autonomamente gli esperimenti; impara invece dai punteggi del processo gaussiano. Con l'accumularsi dei risultati, il sistema riorganizza il proprio spazio di ricerca in modo che le condizioni che si comportano in maniera simile si trovino più vicine, mentre quelle con risultati diversi si allontanino. Il metodo funziona direttamente a partire da una descrizione in inglese corrente della procedura sperimentale.
The researchers evaluated GOLLuM on 23 benchmark tasks spanning organic synthesis, analytical and process chemistry, materials, catalysis and molecular property optimization. Every run began with 10 low-performing observations, and the team used the same configuration across the tasks rather than tuning it separately. GOLLuM ranked first on average and beat Bayesian optimization with expert-designed descriptors on the reported measures. By contrast, direct prompting produced failure rates from 10% to around 80%, including invented chemical structures, repeated conditions and suggestions outside the permitted search space.
I ricercatori hanno valutato GOLLuM in 23 attività di benchmark che comprendevano sintesi organica, chimica analitica e di processo, materiali, catalisi e ottimizzazione delle proprietà molecolari. Ogni esecuzione è iniziata con 10 osservazioni a basse prestazioni e il team ha usato la stessa configurazione in tutte le attività, invece di ottimizzarla separatamente. GOLLuM si è classificato al primo posto in media e ha superato l'ottimizzazione bayesiana con descrittori progettati da esperti nelle metriche riportate. Al contrario, il prompting diretto ha prodotto tassi di fallimento dal 10% a circa l'80%, inclusa l'invenzione di strutture chimiche, la ripetizione di condizioni e suggerimenti al di fuori dello spazio di ricerca consentito.
And so, concretely: research teams could use a language model's broad scientific representations without trusting its answers alone, potentially testing promising recipes with fewer laboratory runs.
In concreto, quindi: i team di ricerca potrebbero usare le ampie rappresentazioni scientifiche di un modello linguistico senza fidarsi esclusivamente delle sue risposte, testando potenzialmente ricette promettenti con meno cicli di laboratorio.