Các mô hình ngôn ngữ lớn (LLM) hỗ trợ các chatbot như ChatGPT có thể ngày càng trở nên tốt hơn trong việc trả lời các câu hỏi chuẩn đo lường lý luận toán học. Nhưng đây thực sự có thể là một điều xấu.
MỘT in trước Bài nghiên cứu do các nhà nghiên cứu tại Scale AI phát hành hôm thứ Tư đã trình bày chi tiết về cách LLM đã đạt được kết quả ấn tượng trong các bài kiểm tra điểm chuẩn toán học nhưng ngày càng có mối lo ngại rằng ô nhiễm dữ liệu đang thúc đẩy điểm cao.
Đây là khi dữ liệu giống như các câu hỏi chuẩn bị rò rỉ vào dữ liệu đào tạo. LLM sau đó có thể kết thúc việc đào tạo theo cách ưu tiên vượt qua các bài kiểm tra tiêu chuẩn này hơn là thực sự hiểu vấn đề toán học mà nó đang cố gắng giải quyết.
Điều này tương tự như khi bạn đang chuẩn bị cho một bài kiểm tra toán bằng cách ghi nhớ câu trả lời thay vì học cách giải bài toán. Vấn đề này được gọi là trang bị quá mức.
Tuy nhiên, các tác giả của bài báo cho biết kết quả của họ không ủng hộ lý thuyết này, cho thấy điều đó không có nghĩa là AI kém khả năng suy luận, chỉ là nó có thể không tốt như các tiêu chuẩn đề xuất.
Xây dựng chuẩn mực toán mới
Trong bài báo, các tác giả đã viết: “Việc một mô hình quá phù hợp không có nghĩa là nó kém khả năng lý luận, mà chỉ đơn thuần là nó không tốt như các tiêu chuẩn đánh giá”. Họ phát hiện ra rằng nhiều mô hình quá phù hợp nhất các mô hình vẫn có thể suy luận và giải quyết các vấn đề mà trước đây chúng chưa từng gặp phải trong tập huấn luyện của mình.
Để thực hiện những đánh giá này, họ đã phát triển bài kiểm tra điểm chuẩn toán học của riêng mình (GSM1k), bài kiểm tra mà họ cho rằng kiểm tra khả năng hiểu vấn đề của AI chứ không chỉ câu trả lời.
Việc một mô hình quá phù hợp không có nghĩa là nó kém về khả năng suy luận, mà chỉ đơn thuần là nó không tốt như các tiêu chuẩn đánh giá.
Tác giả nghiên cứu
Các câu hỏi ở cấp độ toán cấp lớp và một câu hỏi GSM1k điển hình sẽ như sau: Jim muốn chi 15% thu nhập hàng tháng của mình cho cửa hàng tạp hóa. Anh ấy kiếm được 2500 đô la một tháng. Hỏi anh ta sẽ còn lại bao nhiêu tiền? Câu trả lời đúng là $2125.
Mặc dù những câu hỏi như vậy gần giống với những câu hỏi trong bài kiểm tra tiêu chuẩn vàng của ngành (GSM8k), nhưng chúng đủ khác nhau để kiểm tra xem LLM có thể giải được các câu đố toán học mà họ chưa từng thấy trước đây hay không.
Bằng cách sử dụng thử nghiệm mới của mình, nhóm nghiên cứu tại Scal AI đã báo cáo độ chính xác giảm tới 13% khi họ đánh giá các LLM nguồn mở và nguồn đóng hàng đầu. Các mô hình khác ở biên giới như Gemini, GPT và Claude cho thấy dấu hiệu trang bị quá mức ở mức tối thiểu.
Cái gì tiếp theo?
‘Vấn đề’ này có thể tự giải quyết theo thời gian vì các tác giả dự đoán rằng đến năm 2025, môn toán cấp lớp có thể sẽ không còn đủ khó để đánh giá các LLM mới. Tuy nhiên, họ nói rằng việc cải thiện lý luận trong LLM “là một trong những hướng quan trọng nhất của nghiên cứu hiện tại”.
Nhà khoa học nghiên cứu cấp cao tại NVIDIA Jim Fan cho biết trên X rằng các tiêu chuẩn học thuật đang mất dần hiệu lực.
Ông nói rằng ba loại đánh giá LLM sẽ quan trọng trong tương lai sẽ là các bài kiểm tra được tổ chức riêng như quy mô AI, các điểm chuẩn so sánh công khai như Chatbot Arena, nơi bạn có thể kiểm tra các mô hình song song và các điểm chuẩn được quản lý riêng cho từng công ty. trường hợp sử dụng.
- ChatGPT Plus vs Copilot Pro – chatbot cao cấp nào tốt hơn?
- Tôi đã đọ sức với Google Bard với Gemini Pro vs ChatGPT – đây là người chiến thắng
- Runway vs Pika Labs – công cụ video AI nào tốt nhất?