
Anthropic ha analizzato 700.000 conversazioni con il suo assistente AI, Claude, scoprendo 3.307 valori distinti espressi in contesti reali. Questi valori sono stati organizzati in cinque categorie principali: Pratici, Epistemici, Sociali, Protettivi e Personali. Claude ha mostrato una forte adesione ai principi di “utile, onesto, innocuo”, ma in alcuni casi ha espresso valori divergenti, sollevando interrogativi sull’allineamento etico dell’AI. Lo studio evidenzia l’importanza di monitorare continuamente i valori espressi dalle AI per garantire che rimangano allineati agli standard etici desiderati.