Quay lại danh sách

Nghiên Cứu 25.264 Pull Request Xác Nhận: AI Coding Agent Là Công Cụ Của Một Người, Và Đội Nhỏ Dùng Chúng Nhiều Nhất

Đăng ngày 23 thg 7, 20266 phút đọc
AI AgentsDeveloper ToolsGenAI

Giữa năm 2026, phần lớn cuộc trò chuyện trong ngành về AI coding agent xoay quanh quy mô — context window lớn hơn, phiên chạy tự động dài hơn, nhiều agent làm việc song song hơn. Một nghiên cứu thực nghiệm mới từ Rochester Institute of Technology, được Help Net Security đăng tải ngày 22/7/2026, lại chỉ ra điều ngược lại. Hai nhà nghiên cứu Maliha Noushin Raida và Daqing Hou đã thu thập 25.264 pull request được mở bởi GitHub Copilot, OpenAI Codex và Claude Code từ các repository công khai có ít nhất 100 star, trong khoảng thời gian từ tháng 5 đến tháng 7 năm 2025, rồi phân loại từng pull request theo người thực sự review và merge nó. Kết quả cho thấy một bức tranh bình dị hơn nhiều so với cơn sốt multi-agent: trên thực tế, agentic coding vẫn vận hành qua một người gác cổng (gatekeeper) duy nhất, và chính các đội nhỏ — chứ không phải doanh nghiệp lớn — mới là bên sử dụng nó nhiều nhất.

Quy Trình Mặc Định Là Một Người, Không Phải Một Hội Đồng

Con số trung tâm của nghiên cứu là 78,9%: gần bốn trên năm pull request dạng agentic trong bộ dữ liệu được review và merge bởi đúng một người — người đọc diff của agent, sửa những gì cần sửa, rồi nhấn merge. Không có hội đồng review riêng, không có người phê duyệt thứ hai, không có bước QA độc lập — toàn bộ bước xác minh đặt lên vai bất kỳ kỹ sư nào đã mở tác vụ đó. Ngay cả trong số các repository nhỏ hoạt động sôi nổi nhất (được định nghĩa là có hơn 30 pull request dạng agentic), Raida nhận thấy mô hình một người review vẫn là quy trình chiếm đa số, chứ không phải hiện tượng do cỡ mẫu nhỏ.

Đội Nhỏ Là Người Dùng Nhiều Nhất, Với Khoảng Cách Lớn

Phát hiện thứ hai định hình lại việc ai thực sự đang thúc đẩy việc áp dụng agentic coding. Các repository do một đến năm người duy trì có trung bình 50,2 pull request dạng agentic mỗi repo — gấp nhiều lần so với các đội quy mô vừa và lớn trong cùng khoảng thời gian. Giả định trực quan rằng AI coding agent mở rộng tốt nhất bên trong các tổ chức kỹ thuật lớn, có đội platform và hạ tầng review riêng, không đứng vững trước dữ liệu này. Chính những người duy trì đơn lẻ và các đội siêu nhỏ, vốn không có đủ nhân lực cho một người review thứ hai, mới là bên dựa vào agent nhiều nhất.

Tỷ Lệ Merge Không Quan Tâm Có Bao Nhiêu Người Đang Theo Dõi

Có lẽ kết quả phản trực giác nhất là: thêm người review gần như không thay đổi kết quả. Pull request với một người review có tỷ lệ merge 81,2%, trong khi pull request có nhiều người review hoặc nhiều người commit có tỷ lệ merge 80,3% — một khoảng cách nhỏ đến mức làm lung lay giả định rằng có nhiều mắt hơn theo dõi output của agent sẽ tạo ra sự giám sát chặt chẽ hơn đáng kể hoặc ít merge hơn. Bất kể điều gì đang quyết định một PR dạng agentic có được merge hay không, đó không chủ yếu là quy mô của hội đồng review.

Người Duy Trì Đơn Lẻ Xây Feature; Đội Nhóm Sửa Bug

Nghiên cứu cũng phát hiện sự phân hóa trong việc agent được giao làm gì tùy theo cấu trúc đội. Trong các quy trình một người review, loại pull request phổ biến nhất là liên quan đến feature — các nhà phát triển đơn lẻ giao cho agent xây dựng chức năng mới. Trong các quy trình nhiều người, pull request liên quan đến fix phổ biến hơn, cho thấy các đội nhóm dùng agent để giải quyết backlog các lỗi nhỏ, phạm vi rõ ràng, thay vì giao thẳng công việc feature hoàn toàn mới.

Vì Sao Một Nghiên Cứu Về Metadata PR Tưởng Chừng Khô Khan Lại Quan Trọng

Không con số nào trong nghiên cứu này liên quan đến jailbreak, thoát sandbox, hay sự cố bảo mật — và chính vì vậy phát hiện này đáng được xem xét nghiêm túc. Phần lớn cuộc trò chuyện về an toàn và quản trị trong ngành xung quanh agentic coding giả định một mô hình review nhiều lớp: agent đề xuất, con người kiểm tra, đôi khi một người thứ hai hoặc một cổng tự động kiểm tra lại. Dữ liệu này cho thấy trong thực tế, mô hình nhiều lớp đó là ngoại lệ, không phải chuẩn mực. Ranh giới an toàn thực sự cho phần lớn code dạng agentic được đưa vào production hôm nay là phán xét của một kỹ sư duy nhất qua một lượt kiểm tra duy nhất — và kỹ sư đó có xác suất cao là đang làm việc một mình hoặc trong một đội từ năm người trở xuống.

Điều Này Có Ý Nghĩa Gì Với Các Đội Đang Dùng AI Coding Agent Hôm Nay

Với các lãnh đạo kỹ thuật, bài học thực tế không phải là bắt buộc có người review thứ hai cho mọi PR dạng agentic — dữ liệu cho thấy điều đó cũng không thay đổi nhiều kết quả merge. Bài học là đầu tư để người review duy nhất đang tồn tại làm việc hiệu quả nhất có thể: mô tả PR do agent viết dễ hiểu hơn, static analysis và test coverage đủ để bắt được những gì một lượt kiểm tra vội vàng có thể bỏ sót, và xem phán xét của người review đơn lẻ đó chính là lưới an toàn thực sự trong production mà nó vốn đã là. Với các nhà phát triển đơn lẻ và đội nhỏ, nghiên cứu này là một sự xác nhận rằng các quy trình agentic hiện tại vốn đã được xây dựng quanh quy mô của họ, chứ không phải chống lại nó.

Kết Luận

Một nghiên cứu trên 25.264 pull request từ hoạt động của GitHub Copilot, OpenAI Codex và Claude Code cho thấy agentic coding trong thực tế trông không giống một dây chuyền lắp ráp multi-agent, mà giống một nhà phát triển đơn lẻ làm việc cùng một cộng sự nhanh nhạy, không biết mệt: một người review phê duyệt gần 80% PR dạng agentic, tỷ lệ merge gần như không đổi dù có thêm người review, và các đội từ một đến năm người là bên sử dụng nhiều nhất, bỏ xa phần còn lại. Bài học cho bất kỳ ai đang triển khai các công cụ này không phải là thêm quy trình — mà là đảm bảo người duy nhất trong vòng lặp có đủ công cụ để bắt được những gì quan trọng, bởi vì với phần lớn code dạng agentic được đưa ra hôm nay, họ chính là lớp kiểm tra duy nhất.