AI Observatory
Una mappa quotidiana di ciò che viene pubblicato sull’intelligenza artificiale.
← Torna alle ultime pubblicazioni
paper · arXiv · Computation and Language

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Di cosa parla

Mechanist è un sistema autonomo che usa l'IA come strumento scientifico per scoprire automaticamente i meccanismi dietro al comportamento dei modelli di intelligenza artificiale. Costruisce una grande raccolta di conoscenze orientata a capire i modelli e mette insieme metodi per analizzare, testare e intervenire su ipotesi meccanistiche. L'obiettivo dichiarato è ridurre il divario tra le capacità dei modelli e la nostra capacità di capirli e controllarli.

Cosa permette di osservare

Permette di esplorare se agenti automatici possono trovare rischi nascosti nei modelli, spiegare come i modelli formano e usano "credenze" (cioè rappresentazioni di conoscenza) e trasformare queste spiegazioni in interventi pratici per guidarne il comportamento.

agentimodelli linguisticiregolamentazionericercasicurezza

Dalla fonte

AI models have achieved remarkable success across diverse domains, yet the mechanisms underlying their capabilities and the risks they may pose remain poorly understood. As AI development becomes faster and increasingly automated, mechanistic exploration remains largely manual, widening the gap between what models can do and our ability to understand and control them. To bridge this gap, we introduce Mechanist, an agentic system that uses AI as a scientific instrument for the autonomous discovery of mechanisms underlying AI intelligence. To support autonomous mechanistic discovery, we construct an interpretability-focused knowledge graph of approximately 13,000 papers and integrate it with a multidisciplinary database of 43 million papers spanning 26 fields. We further curate a library of 32 foundational methods for mechanism analysis, causal intervention, and validation. Compared with…