As duas versões estão alinhadas bloco a bloco, pela ordem do texto: título, o essencial e depois parágrafo a parágrafo. Quando a tradução fundiu ou dividiu um parágrafo, a casa correspondente fica vazia — nunca aproximamos duas passagens a olho.
At EPFL's Laboratory of Artificial Chemical Intelligence, Bojana Ranković and Philippe Schwaller tested GOLLuM with a narrow budget: 50 experiments to search for strong chemical, materials and molecular conditions. In that evaluation, 36.3% of the conditions it tried landed in the top 5% of all possible outcomes, while the method matched traditional optimization using over 40% fewer experiments.
No Laboratory of Artificial Chemical Intelligence da EPFL, Bojana Ranković e Philippe Schwaller testaram o GOLLuM com um orçamento limitado: 50 experiências para procurar condições químicas, de materiais e moleculares de elevado desempenho. Nessa avaliação, 36,3% das condições que testou ficaram entre os 5% melhores de todos os resultados possíveis, enquanto o método igualou a otimização tradicional usando mais de 40% menos experiências.
Scientists already use Bayesian optimization to decide which experiment to run next. It learns from past results, predicts promising options and estimates uncertainty, helping teams avoid spending time and money on weak candidates. The problem is portability: a model that chooses chemical reactions efficiently may not fit materials or molecular design. Large language models carry broad scientific knowledge, but their confidence is a poor guide to whether a suggestion is correct.
Os cientistas já utilizam a otimização bayesiana para decidir qual a próxima experiência a realizar. O método aprende com resultados anteriores, prevê opções promissoras e estima a incerteza, ajudando as equipas a evitar gastar tempo e dinheiro em candidatos fracos. O problema é a portabilidade: um modelo que escolhe reações químicas de forma eficiente pode não se adaptar a materiais ou ao desenho molecular. Os modelos de linguagem de grande dimensão dispõem de conhecimentos científicos abrangentes, mas a sua confiança é um indicador pouco fiável de que uma sugestão esteja correta.
GOLLuM adds a Gaussian process — a probabilistic model used to score performance and uncertainty — as a built-in doubt detector. The large language model is not asked to choose experiments on its own; instead, it learns from the Gaussian process's scores. As results accumulate, the system reorganizes its search space so conditions that behave alike sit closer together, while conditions with different results move apart. The method works directly from a plain-English description of the experimental procedure.
O GOLLuM acrescenta um processo gaussiano — um modelo probabilístico utilizado para avaliar o desempenho e a incerteza — como detetor de dúvidas integrado. Não é pedido ao modelo de linguagem de grande dimensão que escolha sozinho as experiências; em vez disso, aprende com as pontuações do processo gaussiano. À medida que os resultados se acumulam, o sistema reorganiza o seu espaço de pesquisa para que as condições com comportamentos semelhantes fiquem mais próximas, enquanto as condições com resultados diferentes se afastam. O método funciona diretamente a partir de uma descrição, em linguagem simples, do procedimento experimental.
The researchers evaluated GOLLuM on 23 benchmark tasks spanning organic synthesis, analytical and process chemistry, materials, catalysis and molecular property optimization. Every run began with 10 low-performing observations, and the team used the same configuration across the tasks rather than tuning it separately. GOLLuM ranked first on average and beat Bayesian optimization with expert-designed descriptors on the reported measures. By contrast, direct prompting produced failure rates from 10% to around 80%, including invented chemical structures, repeated conditions and suggestions outside the permitted search space.
Os investigadores avaliaram o GOLLuM em 23 tarefas de benchmark que abrangiam a síntese orgânica, a química analítica e de processos, os materiais, a catálise e a otimização de propriedades moleculares. Cada execução começou com 10 observações de baixo desempenho, e a equipa utilizou a mesma configuração em todas as tarefas, em vez de a ajustar separadamente. O GOLLuM ficou em primeiro lugar, em média, e superou a otimização bayesiana com descritores concebidos por especialistas nas métricas apresentadas. Em contrapartida, a solicitação direta produziu taxas de falha entre 10% e cerca de 80%, incluindo estruturas químicas inventadas, condições repetidas e sugestões fora do espaço de pesquisa permitido.
And so, concretely: research teams could use a language model's broad scientific representations without trusting its answers alone, potentially testing promising recipes with fewer laboratory runs.
Assim, concretamente: as equipas de investigação poderiam utilizar as representações científicas abrangentes de um modelo de linguagem sem confiar apenas nas suas respostas, testando potencialmente receitas promissoras com menos execuções laboratoriais.