Tổ chức nghiên cứu an toàn AI METR đã thực hiện một thí nghiệm với kết luận khiến nhiều người bất ngờ: Các nhà phát triển giàu kinh nghiệm sử dụng công cụ lập trình AI lại hoàn thành nhiệm vụ chậm hơn 19%.
Thiết kế thí nghiệm
METR đã tuyển một nhóm nhà phát triển phần mềm giàu kinh nghiệm và yêu cầu họ hoàn thành các nhiệm vụ lập trình giống nhau trong hai điều kiện:
- Nhóm thí nghiệm: Được tự do sử dụng công cụ lập trình AI
- Nhóm đối chứng: Không sử dụng công cụ AI
Các nhiệm vụ bao gồm sửa lỗi, phát triển tính năng và tái cấu trúc mã nguồn – những tình huống phát triển phổ biến.
Tại sao lại chậm hơn
Nghiên cứu xác định một số nguyên nhân chính:
1. Chi phí kiểm tra
Mã do AI tạo ra không thể được chấp nhận một cách mù quáng; cần phải kiểm tra từng dòng. Các nhà phát triển giàu kinh nghiệm có yêu cầu cao về chất lượng mã, và thời gian dành cho việc kiểm tra và xác minh vượt quá thời gian tiết kiệm được từ việc viết mã bằng AI.
2. Chuyển đổi ngữ cảnh
Việc liên tục chuyển đổi giữa suy nghĩ của bản thân và kiểm tra đầu ra của AI đã làm gián đoạn dòng suy nghĩ (flow state) của nhà phát triển.
3. Xu hướng phụ thuộc quá mức
Một số nhà phát triển nhận thấy sau khi AI đưa ra gợi ý, họ dành thời gian để "huấn luyện" AI thay vì tự viết mã – trong khi tự viết thường nhanh hơn.
Các hạn chế chính
Nghiên cứu này có một số hạn chế quan trọng:
- Kích thước mẫu không lớn
- Loại nhiệm vụ có hạn
- Công cụ AI được sử dụng có thể không phải là phiên bản mới nhất hoặc mạnh nhất
- Bản thân các nhà phát triển "giàu kinh nghiệm" đã rất nhanh, nên ít dư địa để cải thiện
Đối với nhà phát triển mới vào nghề, hiệu quả tăng năng suất từ công cụ AI có thể hoàn toàn khác. Nghiên cứu của METR tập trung vào nhóm "giàu kinh nghiệm" và không thể khái quát hóa cho tất cả nhà phát triển.
Cách hiểu
Nghiên cứu này không nói rằng công cụ lập trình AI là vô dụng, mà là cải thiện hiệu suất không phải tự động. Cần học cách sử dụng đúng cách, áp dụng trong các tình huống phù hợp và thiết lập quy trình cộng tác người-máy hiệu quả.
Nhà phát triển giỏi nhất không phải là người "sử dụng AI nhiều nhất", mà là người biết khi nào nên dùng và khi nào không nên dùng.
Nguồn tham khảo: CocoLoop, Báo cáo nghiên cứu METR