Anthropic, Claude 성능 저하시킨 세 가지 버그 분석

어제(4월 23일), Anthropic은 드문 일을 했습니다. 공개적으로 실수를 인정한 것입니다.

모호한 PR 문구가 아니라 세 가지 구체적인 기술적 결정을 나열했습니다. 언제 변경했는지, 무엇을 변경했는지, 왜 변경했는지, 어떤 결과를 초래했는지, 언제 수정했는지 말입니다.

3월 초부터 4월 중순까지 이 세 가지 변경 사항이 겹치면서 Claude Code는 사용자 눈에 점점 더 멍청해졌습니다. 많은 사람들이 모델 성능 저하라고 생각했지만, 실제로는 특정 시점으로 추적할 수 있는 세 가지 결정이었습니다.

첫 번째 실수: 몰래 Claude를 절전 모드로 전환

날짜: 3월 4일

Claude Code의 기본 추론 깊이가 high(높음)에서 medium(중간)으로 변경되었습니다. 이유는 지연 시간을 줄이고 응답을 더 빠르게 하기 위해서였습니다.

결과는 사용자들이 Claude Code가 분명히 더 멍청해졌다고 느꼈다는 것입니다. 같은 질문에도 출력 품질이 떨어졌습니다.

Anthropic의 결론: "이것은 잘못된 트레이드오프였습니다. 4월 7일에 이 변경 사항을 롤백했습니다. 사용자들이 기본적으로는 높은 지능을 원하고 필요할 때만 낮은 지연 시간을 선택하겠다고 알려주었기 때문입니다."

3월 중순부터 많은 사용자들이 이를 보고했지만, 당시 Anthropic은 원인을 공개적으로 설명하지 않았습니다. 이번에 공식적으로 인정했습니다. 버그가 아니라 능동적으로 내린 잘못된 결정이었습니다.

문제 발생부터 수정까지: 한 달 이상.

두 번째 실수: 캐시 최적화가 건망증 버그를 유발

날짜: 3월 26일

엔지니어링 팀이 캐시 최적화를 하던 중 버그를 도입했습니다.

정상 로직 — 사고 세션 캐시는 사용자가 일정 시간 동안 작업하지 않을 때만 지워집니다. 버그 발생 후에는 사용자가 메시지를 보낼 때마다 지워지게 되었습니다.

결과적으로 Claude는 대화에서 건망증이 심해지고 반복적이 되었습니다. 방금 말한 내용을 다음 메시지에서 잊어버렸습니다. 사용자들은 지능 저하라고 생각했지만, 실제로는 메모리가 새고 있었습니다.

Anthropic의 말: "이것은 사용자가 Claude Code를 사용할 때 경험해야 하는 경험이 아닙니다."

수정 날짜: 4월 10일.

문제 발생부터 수정까지: 15일.

세 번째 실수: 단어 제한 추가, 성능 3% 하락

날짜: 4월 16일

Anthropic이 시스템 프롬프트를 수정하여 두 가지 제한을 추가했습니다.

  • 도구 호출 사이: 최대 25단어
  • 최종 답변: 최대 100단어

목표는 Claude를 더 간결하게 만드는 것이었습니다. 내부 테스트 결과 성능이 3% 하락했습니다.

4월 20일, 이 변경 사항은 롤백되었습니다.

문제 발생부터 수정까지: 4일 — 두 번째 버그보다 훨씬 빠릅니다. 이번에는 적어도 내부 테스트 데이터가 결정을 뒷받침했기 때문입니다.

세 가지 오류가 겹치다

타임라인을 살펴보겠습니다.

변경 날짜구체적인 내용수정 날짜
3월 4일추론 깊이 high → medium4월 7일 (1개월 이상)
3월 26일캐시 버그, 매번 지움4월 10일 (15일)
4월 16일시스템 프롬프트 단어 제한4월 20일 (4일)

사용자들의 느낌은: Claude가 계속 나빠지고 있지만, 무엇이 잘못되었는지 명확하지 않았습니다.

세 가지 문제가 동시에 작용하고 있었기 때문입니다. 사용자들이 보고하는 증상이 뒤섞여 있었고, Anthropic 자체도 파악하는 데 시간이 필요했습니다.

공개 분석 이후

Anthropic의 약속은 세 가지입니다: 테스트 프로세스 개선, 변경 사항 사전 통지, 영향을 받은 계정의 사용 할당량 초기화.

실수를 인정하는 것 자체가 AI 업계에서는 드문 일입니다. 구체적인 날짜와 숫자를 가지고 돌려 말하지 않고 이야기하는 태도는 대부분의 회사보다 낫습니다.

하지만 주목할 만한 세부 사항이 하나 있습니다. 세 번째 버그는 Anthropic이 내부 테스트를 수행한 후에 출시되었습니다 — 그런데도 3% 성능 하락을 발견하고서야 롤백되었습니다. 테스트 프로세스 자체가 이를 막지 못한 것입니다.

이것은 Anthropic만의 문제가 아닙니다. 빠른 반복의 대가는 무엇입니까? 모든 릴리스는 오류 확률에 대한 도박입니다. 사용자의 'AI가 나빠졌다'는 인식은 축적되며, 즉시 원인을 찾기 어렵습니다.

공개 분석이 이 긴장을 해결할 수는 없지만, 적어도 직면하는 시작점이 됩니다.

다음 질문은: 새롭게 약속된 테스트 프로세스가 정말로 다음에 비슷한 변경을 막을 수 있을까입니다. 답은 다음 문제가 발생했을 때만 알 수 있습니다.

출처: Anthropic admits it dumbed down Claude with upgrades (The Register, CocoLoop, 2026년 4월 23일); AI Dispatch: Daily Trends and Innovations – April 23, 2026 (Hipther, 2026년 4월 23일)