Las dos versiones están alineadas bloque a bloque, en el orden del texto: titular, lo esencial y después párrafo a párrafo. Cuando la traducción ha fusionado o dividido un párrafo, la casilla correspondiente queda vacía — nunca emparejamos dos pasajes a ojo.
At EPFL's Laboratory of Artificial Chemical Intelligence, Bojana Ranković and Philippe Schwaller tested GOLLuM with a narrow budget: 50 experiments to search for strong chemical, materials and molecular conditions. In that evaluation, 36.3% of the conditions it tried landed in the top 5% of all possible outcomes, while the method matched traditional optimization using over 40% fewer experiments.
En el Laboratory of Artificial Chemical Intelligence de EPFL, Bojana Ranković y Philippe Schwaller probaron GOLLuM con un presupuesto limitado: 50 experimentos para buscar condiciones químicas, de materiales y moleculares de alto rendimiento. En esa evaluación, el 36,3 % de las condiciones que probó se situó en el 5 % superior de todos los resultados posibles, mientras que el método igualó a la optimización tradicional con más de un 40 % menos de experimentos.
Scientists already use Bayesian optimization to decide which experiment to run next. It learns from past results, predicts promising options and estimates uncertainty, helping teams avoid spending time and money on weak candidates. The problem is portability: a model that chooses chemical reactions efficiently may not fit materials or molecular design. Large language models carry broad scientific knowledge, but their confidence is a poor guide to whether a suggestion is correct.
Los científicos ya utilizan la optimización bayesiana para decidir qué experimento realizar a continuación. Aprende de los resultados anteriores, predice opciones prometedoras y estima la incertidumbre, ayudando a los equipos a no invertir tiempo y dinero en candidatos débiles. El problema es la portabilidad: un modelo que elige reacciones químicas de forma eficiente puede no adaptarse al diseño de materiales o moléculas. Los modelos lingüísticos de gran tamaño incorporan amplios conocimientos científicos, pero su confianza es una mala guía para determinar si una sugerencia es correcta.
GOLLuM adds a Gaussian process — a probabilistic model used to score performance and uncertainty — as a built-in doubt detector. The large language model is not asked to choose experiments on its own; instead, it learns from the Gaussian process's scores. As results accumulate, the system reorganizes its search space so conditions that behave alike sit closer together, while conditions with different results move apart. The method works directly from a plain-English description of the experimental procedure.
GOLLuM añade un proceso gaussiano —un modelo probabilístico utilizado para puntuar el rendimiento y la incertidumbre— como detector integrado de dudas. No se pide al modelo lingüístico de gran tamaño que elija experimentos por sí solo; en su lugar, aprende de las puntuaciones del proceso gaussiano. A medida que se acumulan los resultados, el sistema reorganiza su espacio de búsqueda para que las condiciones que se comportan de forma similar queden más cerca, mientras que las que producen resultados diferentes se alejan. El método funciona directamente a partir de una descripción en inglés claro del procedimiento experimental.
The researchers evaluated GOLLuM on 23 benchmark tasks spanning organic synthesis, analytical and process chemistry, materials, catalysis and molecular property optimization. Every run began with 10 low-performing observations, and the team used the same configuration across the tasks rather than tuning it separately. GOLLuM ranked first on average and beat Bayesian optimization with expert-designed descriptors on the reported measures. By contrast, direct prompting produced failure rates from 10% to around 80%, including invented chemical structures, repeated conditions and suggestions outside the permitted search space.
Los investigadores evaluaron GOLLuM en 23 tareas de referencia sobre síntesis orgánica, química analítica y de procesos, materiales, catálisis y optimización de propiedades moleculares. Cada ejecución comenzó con 10 observaciones de bajo rendimiento, y el equipo utilizó la misma configuración en todas las tareas, en lugar de ajustarla por separado. GOLLuM quedó primero de media y superó a la optimización bayesiana con descriptores diseñados por expertos en las métricas comunicadas. En cambio, la formulación directa de instrucciones produjo tasas de error de entre el 10 % y alrededor del 80 %, e incluyó estructuras químicas inventadas, condiciones repetidas y sugerencias fuera del espacio de búsqueda permitido.
And so, concretely: research teams could use a language model's broad scientific representations without trusting its answers alone, potentially testing promising recipes with fewer laboratory runs.
En concreto: los equipos de investigación podrían utilizar las amplias representaciones científicas de un modelo lingüístico sin confiar únicamente en sus respuestas, y probar potencialmente recetas prometedoras con menos ejecuciones de laboratorio.