Mọi công cụ AI cho nghiên cứu đều nói cùng một câu: “đọc giúp bạn hàng trăm bài báo”. Câu đó không kiểm chứng được. Nó không sai, nhưng cũng không có cách nào phản bác.
Nên chúng tôi đo. Năm model Gemini, trải hai thế hệ, đọc cùng 162 bài báo khoa học và chấm bằng cùng một bộ tiêu chí. Kết quả ngược với kỳ vọng ở cả ba điểm.
Đây là bài đồng hành với Vì sao “không bịa nguồn” là tính năng, không phải khẩu hiệu. Bài đó trích nghiên cứu của người khác về việc mô hình bịa trích dẫn. Bài này là số đo của chính chúng tôi.
Phép thử
Chúng tôi lấy một bộ dữ liệu đã có đáp án: 162 quyết định bài báo × giả thuyết mà cộng đồng khoa học đã tự dán nhãn và phản biện lẫn nhau. Mỗi bài được hỏi cùng một câu:
Bài này có kiểm định giả thuyết không, và ở mức nào: trực tiếp, gián tiếp, hay không liên quan? Và câu nào trong bài chứng minh điều đó?
Ba nhãn, phân bố lệch nặng: 3 bài “kiểm định trực tiếp”, 121 bài “gián tiếp”, 38 bài “không liên quan”.
Mỗi bài báo được tải một lần duy nhất rồi đưa y nguyên cho cả năm model. Nếu để mỗi model tự đi tìm tài liệu, một lần tìm kiếm trục trặc sẽ bị hiểu nhầm thành model kém. Toàn bộ chạy ở nhiệt độ 0, cùng prompt, cùng bộ chấm: 36 phút, 0 lỗi, 95/162 bài có toàn văn mở.
Bộ tiêu chí, và vì sao chọn từng cái
Phần khó không phải là chạy phép đo, mà là chọn đo cái gì.
| Tiêu chí | Vì sao chọn |
|---|---|
| macro-F1 | Chấm đều ba nhãn thay vì để nhãn đông áp đảo. Vì phân bố lệch nặng, đây là chỉ số chính. |
| Liên quan / không liên quan | Quyết định có ý nghĩa nhất với người dùng: giữ bài hay bỏ bài. Cũng là phép chia duy nhất đủ mẫu để kết luận (124 so với 38). |
| Trích dẫn thật | Tỉ lệ câu trích thực sự tồn tại trong bài gốc, đối chiếu bằng máy. Đây là chỉ số chống bịa, và nó không phụ thuộc model. |
| Lượng bằng chứng | Số câu trích hợp lệ rút ra từ cùng 162 bài. Ít không có nghĩa là sai, nhưng người đọc nhận được ít tư liệu hơn hẳn. |
| Accuracy | Công bố cho đủ, nhưng không dùng làm cổng. Lý do ở ngay dưới. |
Vì sao accuracy bị loại khỏi vai trò chỉ số chính
Một model không đọc gì cả, cứ trả lời “gián tiếp” mọi lúc, đạt accuracy 0,747 trên bộ dữ liệu này, chỉ vì 121/162 bài mang nhãn đó.
Nếu một con số làm sản phẩm của bạn trông đẹp mà model đoán bừa cũng đạt được, thì con số đó không đo sản phẩm của bạn.
Bảng điểm
| Model | macro-F1 | Liên quan/không | Trích dẫn thật | Câu trích | Giá/bài |
|---|---|---|---|---|---|
| Gemini 2.5 Flash | 0,468 | 0,885 | 0,884 | 626 | 0,0061 $ |
| Gemini 3.5 Flash | 0,480 | 0,858 | 0,857 | 180 | 0,0217 $ |
| Gemini 3.7 Flash | 0,468 | 0,885 | 0,924 | 257 | chưa có giá |
| Gemini 2.5 Pro | 0,418 | 0,820 | 0,770 | 301 | 0,0223 $ |
| Gemini 3.1 Pro | 0,444 | 0,853 | 0,898 | 168 | 0,0344 $ |
| Model đoán bừa | 0,285 | n/a | n/a | 0 | 0 $ |
Ba điều bảng trên nói
1. Giá không mua được chất lượng
Gemini 3.1 Pro đắt gấp 5,6 lần Gemini 2.5 Flash và thua ở cả ba chỉ số cổng.
Model đắt thứ nhì, Gemini 2.5 Pro, là model tệ nhất trong cả nhóm. Nó cũng là model duy nhất có accuracy (0,710) thấp hơn cả mức của việc đoán bừa (0,747). Nếu ai đó báo cáo rằng model này đạt 71%, con số ấy rỗng.
2. Mới hơn chưa chắc giỏi hơn, nhưng trung thực hơn
Gemini 2.5 Flash (ra 2025) và Gemini 3.7 Flash (ra tuần này) hoà nhau chính xác ở cả ba chỉ số cổng: macro-F1 0,468, liên quan/không 0,885, accuracy 0,796.
Khác biệt duy nhất đáng kể là độ trung thực: model mới bịa ít hơn một phần ba, 7,6% so với 11,6%.
3. Có model dè dặt và model hào phóng
Trên cùng 162 bài báo, số câu trích rút ra chênh nhau 3,7 lần: Gemini 2.5 Flash đưa 626 câu, Gemini 3.1 Pro chỉ đưa 168.
Không có model nào “tốt nhất”. Có model đưa bạn nhiều tư liệu để tự đọc, và có model chỉ đưa vài câu chắc chắn. Biết mình cần cái nào là việc của người dùng, không phải của bảng xếp hạng.
Model nào bịa nhiều nhất
Mỗi câu trích đều bị đối chiếu ngược với văn bản gốc. Sai một chữ số, đảo “tăng” thành “giảm”, hay dựng cả câu không tồn tại, tất cả đều bị loại trước khi tới người đọc.
| Model | Câu trích đưa ra | Bị loại vì không có thật |
|---|---|---|
| Gemini 3.7 Flash | 278 | 7,6% |
| Gemini 3.1 Pro | 187 | 10,2% |
| Gemini 2.5 Flash | 708 | 11,6% |
| Gemini 3.5 Flash | 210 | 14,3% |
| Gemini 2.5 Pro | 391 | 23,0% |
Gần một phần tư số câu trích của Gemini 2.5 Pro không tồn tại trong bài báo mà nó vừa đọc.
Điều chúng tôi chưa làm được
Một báo cáo chỉ đăng phần đẹp thì không phải báo cáo. Ba giới hạn dưới đây nằm trong cùng lần chạy, và chúng quyết định sản phẩm được phép hứa gì.
Hiếm khi bỏ sót: 0,927. Tỉ lệ giữ lại đúng những bài thật sự liên quan. Đây là hướng an toàn cho một công cụ sàng lọc: thà thừa còn hơn đánh rơi bài bạn cần.
Nhưng thừa khá nhiều: 0,421. Tỉ lệ nhận ra bài không liên quan. Bạn vẫn phải tự loại khoảng một nửa số bài nó đẩy sang. Nó đọc trước, bạn quyết định.
Cả năm model đều mù một nhãn: 0,000. Không model nào, qua hai thế hệ, từng gán nhãn “kiểm định trực tiếp”. Đây là hiện tượng hệ thống chứ không phải lỗi của một model, và chúng tôi chưa biết vì sao. Nên chúng tôi không quảng cáo tính năng đó.
Vì sao chọn model rẻ vẫn an toàn
Chốt chặn chống bịa không nằm ở model, mà ở một phép đối chiếu văn bản chạy sau mọi câu trả lời. Model nào bịa thì phần bịa của model đó bị cắt, kể cả model đắt nhất, kể cả model bịa 23%.
Đó là lý do chúng tôi dám chọn model rẻ, và cũng là lý do chúng tôi công bố cả con số bất lợi. Một công cụ bằng chứng mà không dám công bố số đo của chính nó thì đang đòi bạn tin, chứ không đưa bạn bằng chứng.
Ghi chú phương pháp: bộ dữ liệu gồm 162 quyết định bài báo × giả thuyết đã được cộng đồng MecCog phản biện và hợp nhất, quanh năm giả thuyết về APOE và cơ chế thần kinh. Tên model là tên thật trên API, không phải tên thương mại. Giá quy đổi từ token thật đã tiêu; Gemini 3.7 Flash chưa có giá công bố trong bảng giá của chúng tôi tại thời điểm chạy nên ô đó để trống thay vì ước lượng. Kết quả thô từng bài được lưu kèm mã nguồn.