A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench
Di cosa parla
VITA è un sistema clinico pensato per cercare e usare informazioni estratte da un corpus curato di linee guida e protocolli locali, con l’obiettivo di rispondere a quesiti medici in contesti con risorse limitate. Funziona con la cosiddetta retrieval-augmented generation, cioè prima trova documenti rilevanti e poi costruisce la risposta basandosi su quei testi. In confronti pubblici su domande scritte da medici, VITA ha mostrato maggiore accuratezza e completezza rispetto a modelli generali avanzati, pur avendo risposte meno raffinate nella comunicazione.
Cosa permette di osservare
Consente di esplorare se progettare sistemi clinici attorno a una raccolta di testi specifica per il contesto può dare risposte più fondate rispetto a modelli generici, e quali siano i compromessi tra precisione delle informazioni e chiarezza comunicativa.
Dalla fonte
General-purpose large language models (LLMs) have recently been reported to match or exceed specialized clinical AI tools on medical benchmarks, but such comparisons draw on a narrow set of systems and on benchmarks developed largely in high-income settings. We evaluate VITA, a retrieval-augmented generation (RAG) system purpose-built for contextual knowledge retrieval in India and other low- and middle-income (LMIC) settings. VITA retrieves from a curated corpus of disease-specific guidelines, India-specific antimicrobial resistance data, national formulary constraints, and resource-limited care protocols; its architecture and corpus are proprietary, but the benchmark, the physician-written rubrics, and our full response and scoring outputs are public for independent verification. On 4,023 English-language HealthBench questions (80.5% of the benchmark), scored with a GPT-4.1 judge, VIT…