Microsoft vừa hé lộ mẫu trí tuệ nhân tạo Phi-3 mới đầy ấn tượng của mình. Đây là một mô hình nhỏ so với các mô hình như GPT-4, Gemini hoặc Llama 3 nhưng nó có sức mạnh vượt trội so với kích thước của nó.
Được biết đến như các mô hình ngôn ngữ nhỏ, những AI nhẹ này giúp chạy một số tác vụ nhất định rẻ hơn và dễ dàng hơn mà không cần phải sử dụng sức mạnh tính toán nặng nề của các mô hình lớn hơn.
Mặc dù có kích thước nhỏ bé nhưng Phi-3 mini đã hoạt động tốt như Llama 2 trên một số điểm chuẩn và Microsoft cho biết nó có khả năng phản hồi nhanh như một mẫu có kích thước gấp 10 lần.
Điều chưa rõ là liệu điều này có thể là một phần của bản cập nhật trong tương lai cho Copilot hay không khi Microsoft tìm cách mang nhiều chức năng hơn trên thiết bị hay liệu đây có phải là một dự án độc lập hay không.
Microsoft Phi-3 là gì?

Theo Phó chủ tịch Azure Eric Boyd, Microsoft Phi-3 đã được đào tạo theo một “chương trình giảng dạy”. Đang nói chuyện với The VergeBoyd cho biết họ đã lấy danh sách 3000 từ và yêu cầu một mô hình ngôn ngữ lớn hơn để làm sách thiếu nhi để dạy Phi. Sau đó nó được đào tạo về những cuốn sách mới này.
Chúng tôi giới thiệu phi-3-mini … có hiệu suất tổng thể, được đo bằng cả tiêu chuẩn học thuật và thử nghiệm nội bộ, cạnh tranh với các mẫu như Mixtral 8x7B và GPT-3.5 mặc dù đủ nhỏ để triển khai trên điện thoại.
Nghiên cứu của Microsoft
Phi-3 có ba kích cỡ; mini chỉ có 3,8 tỷ tham số, mô hình nhỏ có 7 tỷ tham số và mô hình trung bình có 14 tỷ tham số. So sánh GPT-4 có hơn một nghìn tỷ thông số và mẫu Llama 3 nhỏ nhất có 8 tỷ.
Phi-3 được xây dựng dựa trên việc học từ Phi-1, tập trung vào mã hóa và Phi-2, được dạy về lý luận. Lý do được cải thiện này là cách nó có thể phù hợp với GPT-3.5 về chất lượng phản hồi mặc dù được đào tạo trên tập dữ liệu nhỏ hơn nhiều.
Sự chuyển đổi sang các mô hình nhỏ hơn hoạt động tốt hoặc thậm chí vượt trội hơn các đối thủ lớn đang là một xu hướng ngày càng tăng. Llama 3 70B của Meta gần như đã đạt đến cấp độ GPT-4 ở một số điểm chuẩn và các mẫu nhỏ hơn dường như đang tìm được những ngóc ngách cụ thể.
Các nhà nghiên cứu của Microsoft giải thích rằng hiệu suất của Phi-3 “nghiêng với các mẫu như Mixtral 8x7B và GPT-3.5”. giấy trên mẫu mới. Điều này đã xảy ra “mặc dù nó đủ nhỏ để triển khai trên điện thoại”.
Theo nhóm, sự đổi mới hoàn toàn phụ thuộc vào tập dữ liệu. Điều này được tạo thành từ dữ liệu web được lọc kỹ lưỡng và dữ liệu tổng hợp từ sách dành cho trẻ em do AI khác tạo ra.
Tại sao chúng ta cần Phi-3?
Microsoft Phi-3 được thiết kế để chạy trên nhiều loại thiết bị hơn và nhanh hơn nhiều so với các mẫu máy lớn hơn. Nó nằm trong nhóm các mẫu như StabilityAI Zephyr, Google Gemini Nano và Claude 3 Haiku của Anthropic có thể chạy trên máy tính xách tay hoặc điện thoại — không cần Internet.
Trong tương lai, những mẫu này có thể đi kèm với điện thoại thông minh, được gắn trên một con chip bên trong loa thông minh hoặc thậm chí được tích hợp vào tủ lạnh để cho bạn lời khuyên về thói quen ăn kiêng của mình.
Mặc dù các mô hình dựa trên đám mây như Google Gemini Ultra, Claude 3 Opus và GPT-4-Turbo sẽ luôn hoạt động tốt hơn các mô hình nhỏ hơn trên mọi lĩnh vực, nhưng chúng có một số nhược điểm bao gồm chi phí, tốc độ và yêu cầu kết nối Internet để có thể sử dụng được.
Những mô hình nhỏ bé này sẽ cho phép bạn trò chuyện với trợ lý ảo của mình ngay cả khi bạn không có kết nối Internet, để AI tóm tắt nội dung mà không gửi dữ liệu ngoại tuyến hoặc thậm chí làm việc trên thiết bị Internet vạn vật mà bạn không biết AI đang hoạt động.
Apple được cho là gần như dựa hoàn toàn vào các mô hình địa phương này để cung cấp năng lượng cho thế hệ tính năng AI tổng hợp tiếp theo trong iOS 18 và Google đã triển khai Gemini Nano cho nhiều thiết bị cầm tay Android hơn.
- Apple GPT: tin tức mới nhất, ngày phát hành được đồn đại và các tính năng được dự đoán
- Bing với ChatGPT hiện là Copilot — điều đó có ý nghĩa gì với bạn
- Google ra mắt chatbot Gemini AI cho Bard – và nó có thể đánh bại ChatGPT