Anthropic transforma estados internos do Claude em texto
O Natural Language Autoencoder traduz ativações internas do Claude para linguagem natural e mostra quando o modelo percebe que está sendo avaliado.
1 artigos verificados sobre Interpretabilidade de IA, produtos e movimentos do setor.