Anthropic convierte los estados internos de Claude en texto
Natural Language Autoencoder traduce las activaciones internas de Claude a lenguaje natural y muestra cuándo el modelo detecta que está siendo evaluado.
1 artículos verificados sobre Interpretabilidad de IA, productos y movimientos del sector.