Bỏ qua tới nội dung

· Đội ngũ Phở

Đắt gấp năm lần, kém hơn: đo 5 model AI trên 162 bài báo

Năm model Gemini đọc cùng 162 bài báo khoa học, chấm bằng cùng một bộ tiêu chí. Model đắt gấp 5,6 lần thua model rẻ nhất ở mọi chỉ số.

Trong bài này

Mọi công cụ AI cho nghiên cứu đều nói cùng một câu: “đọc giúp bạn hàng trăm bài báo”. Câu đó không kiểm chứng được. Nó không sai, nhưng cũng không có cách nào phản bác.

Nên chúng tôi đo. Năm model Gemini, trải hai thế hệ, đọc cùng 162 bài báo khoa học và chấm bằng cùng một bộ tiêu chí. Kết quả ngược với kỳ vọng ở cả ba điểm.

Đây là bài đồng hành với Vì sao “không bịa nguồn” là tính năng, không phải khẩu hiệu. Bài đó trích nghiên cứu của người khác về việc mô hình bịa trích dẫn. Bài này là số đo của chính chúng tôi.

Phép thử

Chúng tôi lấy một bộ dữ liệu đã có đáp án: 162 quyết định bài báo × giả thuyết mà cộng đồng khoa học đã tự dán nhãn và phản biện lẫn nhau. Mỗi bài được hỏi cùng một câu:

Bài này có kiểm định giả thuyết không, và ở mức nào: trực tiếp, gián tiếp, hay không liên quan? Và câu nào trong bài chứng minh điều đó?

Ba nhãn, phân bố lệch nặng: 3 bài “kiểm định trực tiếp”, 121 bài “gián tiếp”, 38 bài “không liên quan”.

Mỗi bài báo được tải một lần duy nhất rồi đưa y nguyên cho cả năm model. Nếu để mỗi model tự đi tìm tài liệu, một lần tìm kiếm trục trặc sẽ bị hiểu nhầm thành model kém. Toàn bộ chạy ở nhiệt độ 0, cùng prompt, cùng bộ chấm: 36 phút, 0 lỗi, 95/162 bài có toàn văn mở.

Bộ tiêu chí, và vì sao chọn từng cái

Phần khó không phải là chạy phép đo, mà là chọn đo cái gì.

Tiêu chíVì sao chọn
macro-F1Chấm đều ba nhãn thay vì để nhãn đông áp đảo. Vì phân bố lệch nặng, đây là chỉ số chính.
Liên quan / không liên quanQuyết định có ý nghĩa nhất với người dùng: giữ bài hay bỏ bài. Cũng là phép chia duy nhất đủ mẫu để kết luận (124 so với 38).
Trích dẫn thậtTỉ lệ câu trích thực sự tồn tại trong bài gốc, đối chiếu bằng máy. Đây là chỉ số chống bịa, và nó không phụ thuộc model.
Lượng bằng chứngSố câu trích hợp lệ rút ra từ cùng 162 bài. Ít không có nghĩa là sai, nhưng người đọc nhận được ít tư liệu hơn hẳn.
AccuracyCông bố cho đủ, nhưng không dùng làm cổng. Lý do ở ngay dưới.

Vì sao accuracy bị loại khỏi vai trò chỉ số chính

Một model không đọc gì cả, cứ trả lời “gián tiếp” mọi lúc, đạt accuracy 0,747 trên bộ dữ liệu này, chỉ vì 121/162 bài mang nhãn đó.

Nếu một con số làm sản phẩm của bạn trông đẹp mà model đoán bừa cũng đạt được, thì con số đó không đo sản phẩm của bạn.

Bảng điểm

Modelmacro-F1Liên quan/khôngTrích dẫn thậtCâu tríchGiá/bài
Gemini 2.5 Flash0,4680,8850,8846260,0061 $
Gemini 3.5 Flash0,4800,8580,8571800,0217 $
Gemini 3.7 Flash0,4680,8850,924257chưa có giá
Gemini 2.5 Pro0,4180,8200,7703010,0223 $
Gemini 3.1 Pro0,4440,8530,8981680,0344 $
Model đoán bừa0,285n/an/a00 $

Ba điều bảng trên nói

1. Giá không mua được chất lượng

Gemini 3.1 Pro đắt gấp 5,6 lần Gemini 2.5 Flash và thua ở cả ba chỉ số cổng.

Model đắt thứ nhì, Gemini 2.5 Pro, là model tệ nhất trong cả nhóm. Nó cũng là model duy nhất có accuracy (0,710) thấp hơn cả mức của việc đoán bừa (0,747). Nếu ai đó báo cáo rằng model này đạt 71%, con số ấy rỗng.

2. Mới hơn chưa chắc giỏi hơn, nhưng trung thực hơn

Gemini 2.5 Flash (ra 2025) và Gemini 3.7 Flash (ra tuần này) hoà nhau chính xác ở cả ba chỉ số cổng: macro-F1 0,468, liên quan/không 0,885, accuracy 0,796.

Khác biệt duy nhất đáng kể là độ trung thực: model mới bịa ít hơn một phần ba, 7,6% so với 11,6%.

3. Có model dè dặt và model hào phóng

Trên cùng 162 bài báo, số câu trích rút ra chênh nhau 3,7 lần: Gemini 2.5 Flash đưa 626 câu, Gemini 3.1 Pro chỉ đưa 168.

Không có model nào “tốt nhất”. Có model đưa bạn nhiều tư liệu để tự đọc, và có model chỉ đưa vài câu chắc chắn. Biết mình cần cái nào là việc của người dùng, không phải của bảng xếp hạng.

Model nào bịa nhiều nhất

Mỗi câu trích đều bị đối chiếu ngược với văn bản gốc. Sai một chữ số, đảo “tăng” thành “giảm”, hay dựng cả câu không tồn tại, tất cả đều bị loại trước khi tới người đọc.

ModelCâu trích đưa raBị loại vì không có thật
Gemini 3.7 Flash2787,6%
Gemini 3.1 Pro18710,2%
Gemini 2.5 Flash70811,6%
Gemini 3.5 Flash21014,3%
Gemini 2.5 Pro39123,0%

Gần một phần tư số câu trích của Gemini 2.5 Pro không tồn tại trong bài báo mà nó vừa đọc.

Điều chúng tôi chưa làm được

Một báo cáo chỉ đăng phần đẹp thì không phải báo cáo. Ba giới hạn dưới đây nằm trong cùng lần chạy, và chúng quyết định sản phẩm được phép hứa gì.

Hiếm khi bỏ sót: 0,927. Tỉ lệ giữ lại đúng những bài thật sự liên quan. Đây là hướng an toàn cho một công cụ sàng lọc: thà thừa còn hơn đánh rơi bài bạn cần.

Nhưng thừa khá nhiều: 0,421. Tỉ lệ nhận ra bài không liên quan. Bạn vẫn phải tự loại khoảng một nửa số bài nó đẩy sang. Nó đọc trước, bạn quyết định.

Cả năm model đều mù một nhãn: 0,000. Không model nào, qua hai thế hệ, từng gán nhãn “kiểm định trực tiếp”. Đây là hiện tượng hệ thống chứ không phải lỗi của một model, và chúng tôi chưa biết vì sao. Nên chúng tôi không quảng cáo tính năng đó.

Vì sao chọn model rẻ vẫn an toàn

Chốt chặn chống bịa không nằm ở model, mà ở một phép đối chiếu văn bản chạy sau mọi câu trả lời. Model nào bịa thì phần bịa của model đó bị cắt, kể cả model đắt nhất, kể cả model bịa 23%.

Đó là lý do chúng tôi dám chọn model rẻ, và cũng là lý do chúng tôi công bố cả con số bất lợi. Một công cụ bằng chứng mà không dám công bố số đo của chính nó thì đang đòi bạn tin, chứ không đưa bạn bằng chứng.


Ghi chú phương pháp: bộ dữ liệu gồm 162 quyết định bài báo × giả thuyết đã được cộng đồng MecCog phản biện và hợp nhất, quanh năm giả thuyết về APOE và cơ chế thần kinh. Tên model là tên thật trên API, không phải tên thương mại. Giá quy đổi từ token thật đã tiêu; Gemini 3.7 Flash chưa có giá công bố trong bảng giá của chúng tôi tại thời điểm chạy nên ô đó để trống thay vì ước lượng. Kết quả thô từng bài được lưu kèm mã nguồn.

Câu hỏi thường gặp

Model AI nào đọc bài báo khoa học tốt nhất?

Không có model nào tốt nhất. Trong phép đo của chúng tôi, Gemini 2.5 Flash và Gemini 3.7 Flash hoà nhau ở cả ba chỉ số cổng (macro-F1 0,468 · liên quan/không 0,885 · accuracy 0,796), trong khi Gemini 2.5 Pro thua ở mọi chỉ số dù đắt hơn gần bốn lần. Khác biệt đáng kể giữa các model là lượng bằng chứng rút ra và tỉ lệ bịa trích dẫn, không phải điểm số tổng.

Model đắt tiền có đọc bài báo tốt hơn không?

Không, ít nhất là ở phép thử này. Gemini 3.1 Pro đắt gấp 5,6 lần Gemini 2.5 Flash và thua ở cả ba chỉ số cổng. Gemini 2.5 Pro là model tệ nhất trong nhóm và là model duy nhất có accuracy 0,710 thấp hơn cả mức 0,747 mà một model đoán bừa đạt được.

Model nào bịa trích dẫn nhiều nhất?

Gemini 2.5 Pro, với 23,0% số câu trích không tồn tại trong bài báo gốc. Thấp nhất là Gemini 3.7 Flash với 7,6%. Mọi câu trích bịa đều bị chặn trước khi tới người đọc, vì chốt chặn đối chiếu văn bản chạy sau mọi câu trả lời và không phụ thuộc vào model.

Vì sao không dùng accuracy làm chỉ số chính?

Vì nhãn trong bộ dữ liệu lệch nặng: 3 primary, 121 secondary, 38 unrelated. Một model không đọc gì, cứ trả lời "gián tiếp" mọi lúc, đạt accuracy 0,747. Con số đó không đo năng lực đọc hiểu, nên chúng tôi công bố nó nhưng chấm bằng macro-F1 và phép chia liên quan/không liên quan.

Phép đo này có nhược điểm gì?

Có ba. Hệ thống thừa khá nhiều: nó chỉ nhận ra 0,421 số bài thật sự không liên quan, nên người dùng vẫn phải tự loại khoảng một nửa số bài được đẩy sang. Nhãn "kiểm định trực tiếp" chưa đo được vì cả năm model đều chưa từng gán nhãn đó. Và bộ dữ liệu chỉ có 162 bài quanh năm giả thuyết, không đại diện cho mọi lĩnh vực.

Đọc tiếp