Anthropic transforme les états internes de Claude en texte
Natural Language Autoencoder traduit les activations internes de Claude en langage naturel et révèle quand le modèle semble savoir qu'il est évalué.
1 articles vérifiés sur Interprétabilité de l'IA, les produits et le secteur.