Anthropic macht Claudes innere Zustände lesbar
Der Natural Language Autoencoder übersetzt Claudes interne Aktivierungen in Text und zeigt, wann das Modell eine Evaluation erkennt.
1 geprüfte Beiträge zu KI-Interpretierbarkeit, Produkten und Branchenentwicklungen.