OpenAI được cho là sẽ sớm loại bỏ GPT-5 – đây là những gì chúng ta biết về mẫu thế hệ tiếp theo

By
Jugo Mobile
Jugo Mobile is a platform dedicated to high-quality content in gaming, sports, and tech. Engage with high-quality content and connect with fellow enthusiasts and experts. Explore...
Đọc 12 phút

Mạng xã hội đang xôn xao tin đồn về một thông báo lớn về OpenAI. Điều này được khơi dậy nhờ sự thành công của Llama 3 của Meta (với mẫu lớn hơn sẽ ra mắt vào tháng 7) cũng như một loạt hình ảnh khó hiểu được chia sẻ bởi phòng thí nghiệm AI hiển thị số 22.

Vì ngày 22 tháng 4 là sinh nhật của Giám đốc điều hành OpenAI Sam Altman – anh ấy 39 tuổi – nên có nhiều tin đồn cho rằng công ty sẽ tung ra thứ gì đó lớn như Sora hoặc thậm chí là GPT-5 được nhiều người mong đợi.

Nếu là cái sau và chúng ta có được một mô hình AI mới quan trọng thì đó sẽ là một thời điểm quan trọng trong trí tuệ nhân tạo vì Altman đã tuyên bố trước đó rằng nó sẽ “tốt hơn đáng kể” so với người tiền nhiệm và sẽ khiến mọi người ngạc nhiên.

Cá nhân tôi nghĩ nhiều khả năng nó sẽ giống như GPT-4.5 hoặc thậm chí là bản cập nhật mới cho DALL-E, mô hình tạo hình ảnh của OpenAI nhưng đây là tất cả những gì chúng tôi biết về GPT-5 để đề phòng.

Chúng ta biết gì về GPT-5?

Bài đăng được chia sẻ bởi OpenAI (@openai)

Một bức ảnh được đăng bởi

Chúng tôi biết rất ít về GPT-5 vì OpenAI phần lớn vẫn giữ kín về hiệu suất và chức năng của mẫu thế hệ tiếp theo. Chúng tôi biết rằng mọi chuyện sẽ “tốt hơn về mặt vật chất” vì Altman đã nhiều lần đưa ra tuyên bố đó trong các cuộc phỏng vấn.

Nó rất có thể sẽ là đa phương thức, có nghĩa là nó có thể lấy đầu vào từ nhiều thứ hơn là chỉ văn bản nhưng vẫn chưa rõ ở mức độ nào.

Mỗi mô hình ngôn ngữ lớn mới từ OpenAI là một cải tiến đáng kể so với thế hệ trước về lý luận, mã hóa, kiến ​​thức và hội thoại. GPT-5 sẽ không khác.

Nó đã được đào tạo từ cuối năm ngoái và sẽ có nhiều hơn đáng kể so với 1,5 nghìn tỷ thông số trong GPT-4 hoặc một con số tương tự nhưng kiến ​​trúc cơ bản mạnh mẽ hơn cho phép cải thiện hiệu suất đáng kể mà không cần tăng kích thước mô hình tổng thể.

Đây là điều mà chúng tôi đã thấy từ những người khác như Meta với Llama 3 70B, một mô hình nhỏ hơn nhiều so với GPT-3.5 nhưng hoạt động ở mức tương tự về điểm chuẩn.

Trò chuyện GPT-5 rất có thể sẽ là đa phương thức, có nghĩa là nó có thể nhận đầu vào từ nhiều thứ hơn là chỉ văn bản nhưng vẫn chưa rõ ở mức độ nào. Các mô hình Gemini 1.5 của Google có thể hiểu văn bản, hình ảnh, video, giọng nói, mã, thông tin không gian và thậm chí cả âm nhạc. GPT-5 có thể có khả năng tương tự.

GPT-5 sẽ có thể làm gì?

Sam Altman sẽ rời OpenAI để đến với Microsoft

(Tín dụng hình ảnh: Getty)

Một trong những thay đổi lớn nhất mà chúng ta có thể thấy với GPT-5 so với các phiên bản trước là sự chuyển trọng tâm từ chatbot sang tổng đài viên. Điều này sẽ cho phép mô hình AI phân công nhiệm vụ cho các mô hình phụ hoặc kết nối với các dịch vụ khác nhau và tự mình thực hiện các hành động trong thế giới thực.

Đây là lĩnh vực mà toàn ngành đang khám phá và là một phần điều kỳ diệu đằng sau thiết bị AI Rabbit r1. Nó cho phép người dùng làm nhiều việc hơn là chỉ hỏi AI một câu hỏi, thay vào đó bạn có thể yêu cầu AI xử lý các cuộc gọi, đặt chuyến bay hoặc tạo bảng tính từ dữ liệu mà nó thu thập được ở nơi khác.

Một ứng dụng tiềm năng của các đại lý là quản lý các công việc trong cuộc sống hàng ngày. Bạn có thể cung cấp cho ChatGPT với GPT-5 các yêu cầu về chế độ ăn uống của bạn, quyền truy cập vào camera tủ lạnh thông minh và tài khoản cửa hàng tạp hóa của bạn và nó có thể tự động đặt hàng bổ sung mà bạn không cần phải tham gia.

Tôi nghĩ điều này khó có thể xảy ra trong năm nay nhưng các đại lý chắc chắn là hướng đi cho ngành AI, đặc biệt là khi ngày càng có nhiều thiết bị và hệ thống thông minh được kết nối.

GPT-5 sẽ khác biệt như thế nào?

Hình ảnh điện thoại thông minh đã tải OpenAI ChatGPT sẵn sàng sử dụng

(Tín dụng hình ảnh: Hình ảnh Getty)

Một điều chúng ta có thể thấy với GPT-5, đặc biệt là trong ChatGPT, là OpenAI theo sau Google với Gemini và cấp cho nó quyền truy cập Internet theo mặc định. Điều này sẽ loại bỏ vấn đề cắt dữ liệu khi nó chỉ có kiến ​​thức cập nhật vào ngày kết thúc đào tạo.

Đa phương thức mở rộng cũng có thể có nghĩa là việc tương tác với GPT-5 bằng giọng nói, video hoặc lời nói sẽ trở thành mặc định thay vì một tùy chọn bổ sung. Điều này sẽ giúp OpenAI dễ dàng biến ChatGPT thành trợ lý thông minh như Siri hay Google Gemini hơn.

Cuối cùng, tôi nghĩ cửa sổ ngữ cảnh sẽ lớn hơn nhiều so với hiện tại. Hiện tại nó có khoảng 128.000 mã thông báo – đó là lượng cuộc trò chuyện mà nó có thể lưu trữ trong bộ nhớ trước khi quên những gì bạn đã nói khi bắt đầu cuộc trò chuyện.

Chúng tôi đã thấy một số mô hình như Gemini Pro 1.5 với hơn một triệu cửa sổ ngữ cảnh và những cửa sổ ngữ cảnh lớn hơn này rất cần thiết cho việc phân tích video do số điểm dữ liệu từ video tăng lên so với văn bản đơn giản hoặc hình ảnh tĩnh.

Đưa robot ra ngoài

OpenAI Hình 01 robot xử lý một quả táo

(Tín dụng hình ảnh: Hình OpenAI)

Một trong những xu hướng lớn nhất về AI sáng tạo trong năm qua là cung cấp bộ não cho robot hình người, cho phép chúng tự thực hiện các nhiệm vụ mà không cần nhà phát triển phải lập trình mọi hành động và mệnh lệnh trước khi robot có thể thực hiện.

OpenAI đã đầu tư rất nhiều vào công ty khởi nghiệp về robot Hình, sử dụng GPT-4 để cung cấp năng lượng cho Hình 01 và GPT-5 có thể sẽ có một số dữ liệu nhận thức về không gian như một phần trong quá trình đào tạo để làm cho điều này trở nên đáng tin cậy và có khả năng hơn nữa —hiểu cách con người tương tác với thế giới .

Nvidia cũng đang nghiên cứu các mô hình AI trong không gian này và sẽ được phổ biến rộng rãi. Giáo sư Amnon Shashua, người sáng lập công ty khởi nghiệp AI21, đã ra mắt Mentee Robotics để tạo ra các robot hỗ trợ GenAI có thể tìm đường vào nhà và nơi làm việc vào đầu năm tới.

Google cũng đang xây dựng các robot hỗ trợ AI có thể sử dụng các phiên bản tương lai của mô hình Gemini, đặc biệt là với các cửa sổ ngữ cảnh lớn và Meta đang đào tạo Llama để hiểu thông tin không gian cho các thiết bị AR dựa trên AI hiệu quả hơn như kính thông minh.

Tất cả điều này có nghĩa là gì

Về cơ bản, chúng ta đang bắt đầu đi đến một điểm – như nhà khoa học AI trưởng của Meta, Yann LeCun dự đoán – nơi toàn bộ cuộc sống số của chúng ta phải trải qua bộ lọc AI. Tác nhân và tính đa phương thức trong GPT-5 có nghĩa là các mô hình AI này có thể thay mặt chúng ta thực hiện các nhiệm vụ và robot đưa AI vào thế giới thực.

OpenAI đang phải đối mặt với sự cạnh tranh ngày càng tăng từ các mô hình nguồn mở của các công ty như Mistral và Meta, cũng như các đối thủ cạnh tranh trực tiếp như Anthropic với Claude và Google với Gemini. Sau đó, bạn sẽ yêu cầu Microsoft thoát khỏi sự phụ thuộc vào OpenAI — mặc dù tôi vẫn nghĩ OpenAI sẽ xuất hiện tại Build 2024 vào tháng 5.

Trước khi chúng ta thấy GPT-5, tôi nghĩ OpenAI sẽ phát hành phiên bản trung gian như GPT-4.5 với dữ liệu đào tạo cập nhật hơn, cửa sổ ngữ cảnh lớn hơn và hiệu suất được cải thiện. GPT-3.5 là một bước tiến đáng kể so với mô hình GPT-3 cơ bản và khởi đầu ChatGPT.

Altman cho biết họ có một số mô hình và sản phẩm thú vị sẽ phát hành trong năm nay bao gồm Sora, có thể là sản phẩm giọng nói AI Voice Engine và một số dạng mô hình ngôn ngữ AI thế hệ tiếp theo.

  • Bước nhảy vọt về AI ‘siêu thông minh’ của OpenAI suýt khiến công ty sụp đổ – đây là lý do
  • OpenAI đang trả tiền cho các nhà nghiên cứu để ngăn chặn AI siêu thông minh trở nên lừa đảo
  • OpenAI đang xây dựng AI GPT-5 thế hệ tiếp theo – và CEO tuyên bố nó có thể siêu thông minh

Chia sẻ bài viết này
Theo dõi
Jugo Mobile is a platform dedicated to high-quality content in gaming, sports, and tech. Engage with high-quality content and connect with fellow enthusiasts and experts. Explore the latest trends and innovations in our vibrant community. Join us and experience the future today!