Benchmark SWE-bench Verified: Đo Lường Khả Năng Giải Quyết GitHub Issue Thực Tế Của Các Mô Hình LLM | DevPrompt Lab

Đánh giá toàn diện điểm số SWE-bench Verified: Claude 3.7 Sonnet, OpenAI o3-mini, DeepSeek-R1 và Gemini 2.0 Flash.

Benchmark SWE-bench Verified: Đo Lường Khả Năng Giải Quyết GitHub Issue Thực Tế Của Các Mô Hình LLM

Trong nhiều năm, các bài kiểm tra đánh giá AI như **HumanEval** (chỉ yêu cầu viết một hàm đơn giản dựa trên docstring) đã trở nên quá d�

và không phản ánh đúng năng lực lập trình thực tế. **SWE-bench** (Software Engineering Benchmark) đã thay đổi hoàn toàn cục diện đánh giá: mô hình AI nhận một issue có thật từ các repository mã nguồn mở nổi tiếng (như Django, SymPy, scikit-learn), tự đọc toàn bộ repo, sửa code và phải vượt qua toàn bộ unit test suite khắt khe của dự án.

---

1. Kết Quả SWE-bench Verified (Cập Nhật 2025)

| Mô hình AI | Chế độ (Mode) | Điểm SWE-bench Verified | Chi phí trung bình / Issue | Tốc độ suy luận (Time to solve) |

| :--- | :--- | :--- | :--- | :--- |

| **Claude 3.7 Sonnet** | Extended Thinking (16k tokens) | **56.8%** | $0.42 | 48 giây |

| **OpenAI o3-mini** | High Reasoning Effort | **54.2%** | $0.28 | 35 giây |

| **DeepSeek-R1** | Full Reasoning | **49.2%** | $0.07 | 62 giây |

| **Claude 3.5 Sonnet** | Standard | **41.4%** | $0.18 | 22 giây |

| **OpenAI o1** | Standard | **48.9%** | $0.65 | 55 giây |

| **Gemini 2.0 Flash** | Thinking Enabled | **42.6%** | $0.05 | 18 giây |

---

2. Phân Tích Chuyên Sâu Từng Mô Hình

Claude 3.7 Sonnet với Chế Độ Thinking Mở Rộng

Claude 3.7 Sonnet hiện giữ kỷ lục thế giới trên bảng xếp hạng SWE-bench. Khi bật chế độ suy nghĩ mở rộng (Extended Thinking), mô hình dành ra khoảng 15-30 giây đầu tiên để:

1. Tự lập luận về nguyên nhân gốc r�

(Root Cause Analysis).

2. Kiểm tra xem sự thay đổi có làm hỏng các bài test hiện có (Regression Risk) hay không.

3. Lập kế hoạch từng bước trước khi xuất mã nguồn.

Tỷ lệ "sửa một lỗi nhưng sinh ra lỗi khác" giảm tới 65% so với các phiên bản trước.

DeepSeek-R1: Hiệu Quả Chi Phí Cực Cao (Cost-to-Performance King)

Với chi phí chỉ **$0.07 mỗi issue** (rẻ bằng 1/6 so với Claude 3.7), DeepSeek-R1 đạt số điểm ấn tượng 49.2%. Mô hình này đặc biệt xuất sắc trong các bài toán về thuật toán, toán học và xử lý logic chuỗi phức tạp trong Python và C++. Tuy nhiên, trong các tác vụ liên quan đến framework web hiện đại (React/Next.js), nó đôi khi sử dụng cú pháp của các phiên bản cũ hơn.

OpenAI o3-mini: Cân Bằng Hoàn Hảo Giữa Tốc Độ Và Trí Tuệ

o3-mini là mô hình suy luận (reasoning model) có tốc độ phản hồi nhanh nhất hiện nay. Trong bài toán debug concurrency và race conditions trong Golang, o3-mini cho kết quả chính xác tương đương với các mô hình kích thước khổng lồ.