OpenAI sắp cạnh tranh với Alexa và Siri? Nhà sản xuất ChatGPT nộp nhãn hiệu cho Voice Engine

By
Jugo Mobile
Jugo Mobile is a platform dedicated to high-quality content in gaming, sports, and tech. Engage with high-quality content and connect with fellow enthusiasts and experts. Explore...
Đọc 9 phút

OpenAI có thể đang nhắm đến Apple, Amazon và Google cho nỗ lực thúc đẩy trí tuệ nhân tạo lớn tiếp theo, chiếm lĩnh thị trường trợ lý giọng nói với công cụ Voice Engine mới.

Mặc dù ChatGPT có giao diện thân thiện với giọng nói trên thiết bị di động — và gần đây đã giới thiệu cách để ChatGPT nói câu trả lời trên máy tính để bàn —a đơn đăng ký nhãn hiệu mới từ OpenAI cho các từ Voice Engine liên quan cụ thể đến việc xây dựng trợ lý giọng nói kỹ thuật số.

Hiện tại có thể hoán đổi trợ lý giọng nói mặc định trên Android. Apple dường như đang đàm phán với một loạt công ty AI về tương lai của trí tuệ nhân tạo trên iPhone, vì vậy đây có thể là động thái phủ đầu từ việc xây dựng OpenAI trên một thị trường mới đầy tiềm năng.

Apple cũng được cho là sẽ mở Cửa hàng ứng dụng AI chuyên dụng với bản nâng cấp lớn tiếp theo cho iOS, điều này sẽ tạo ra một thị trường mới cho các trợ lý hỗ trợ AI.

Sam Altman, Giám đốc điều hành OpenAI cho biết có “nhiều thứ khác nhau” sẽ được phát hành trong năm nay. Mặc dù dự kiến ​​​​điều này sẽ bao gồm Sora, công cụ video AI, nó có thể bao gồm một hệ thống giọng nói AI mới.

Chúng ta biết gì về Voice Engine

Sam Altman sẽ rời OpenAI để đến với Microsoft

(Tín dụng hình ảnh: Getty)

Chúng tôi không biết nhiều về Voice Engine hay liệu nó có trở thành một sản phẩm hay không. OpenAI chưa bình luận công khai về nó, vì vậy tất cả những gì chúng tôi có chỉ là tin đồn và việc nộp đơn đăng ký nhãn hiệu.

Mặc dù Voice Engine có thể là một mô hình mới được xây dựng dành riêng cho các ứng dụng giọng nói, nhưng cũng có khả năng đây là một phần trong trò chơi doanh nghiệp dành cho OpenAI. Đó có thể là xây dựng một hệ thống giọng nói chất lượng cao cho phép các công ty xây dựng các bot trung tâm cuộc gọi hiệu quả hơn.

Nghe có vẻ giống như tất cả những thứ bạn cần để có một trợ lý giọng nói AI tương tác đầy đủ chức năng, không chỉ có thể xử lý các tác vụ phức tạp mà còn trò chuyện một cách tự nhiên và thậm chí thay mặt bạn nhận cuộc gọi điện thoại.

Đơn đăng ký nhãn hiệu mới đã được nộp cho Văn phòng Nhãn hiệu và Bằng sáng chế Hoa Kỳ vào tuần trước. Mặc dù một ứng dụng không nhất thiết có nghĩa là nó sẽ tạo ra một sản phẩm, nhưng điều này phù hợp với việc thị trường rộng lớn hơn đang chuyển hướng nhiều hơn sang giọng nói và hướng của OpenAI đến các mô hình được nhắm mục tiêu.

Hồ sơ bao gồm việc tạo ra phần mềm được sử dụng để xây dựng trợ lý giọng nói kỹ thuật số, tạo âm thanh từ lời nhắc văn bản, xử lý lệnh bằng giọng nói và cung cấp dịch vụ giọng nói.

Ứng dụng đầy đủ bao gồm việc phát triển phân phối dịch vụ thoại, sử dụng AI cho văn bản hoặc giọng nói và chuyển văn bản thành âm thanh, ngôn ngữ tự nhiên và xử lý giọng nói, tạo âm thanh và giọng nói từ lời nhắc (văn bản, lời nói, hình ảnh, hình ảnh), xử lý lệnh thoại, nhận dạng giọng nói và xây dựng trợ lý giọng nói kỹ thuật số.

Nghe có vẻ giống tất cả những thứ bạn cần để có một trợ lý giọng nói AI tương tác đầy đủ chức năng, có thể xử lý các tác vụ phức tạp, trò chuyện một cách tự nhiên và thậm chí thay mặt bạn nhận cuộc gọi điện thoại.

GPT-5 phù hợp với điều này ở đâu?

ChatGPT Voice miễn phí

(Tín dụng hình ảnh: OpenAI)

OpenAI đã phát hành GPT-4 một năm trước. Vào thời điểm đó, đây là mô hình AI mang tính đột phá hỗ trợ ChatGPT và Microsoft Copilot.

Công ty cũng bắt đầu đào tạo GPT-5 vào cuối năm ngoái, dẫn đến suy đoán về ngày phát hành của nó. Altman đã nói podcaster Lex Fridman“Chúng tôi sẽ phát hành một mẫu mới tuyệt vời trong năm nay,” nhưng sẽ không xác nhận liệu đây là GPT-5 hay tiền thân nào đó.

Ông cũng cho biết sẽ có “nhiều thứ khác nhau” được phát hành trong những tháng tới. Theo OpenAI CTO Mira Murati, điều này sẽ bao gồm nền tảng video AI Sora.

Có một số suy đoán trên mạng xã hội rằng Sora và Voice Engine mới này là các giao diện phương thức khác nhau cho GPT-5.

Rất có khả năng GPT-5 sẽ là một mô hình đa phương thức thực sự, có thể hiểu video, hình ảnh, giọng nói, văn bản và mã — cũng như tạo ra tất cả các loại nội dung đó.

Voice Engine có thể là Trợ lý mới

Dựa vào mô tả của nhãn hiệu, cũng có thể Voice Engine có thể là một trợ lý giọng nói mới, kết hợp các khả năng rộng hơn của Siri, Alexa hoặc Google Assistant với khả năng lý luận và ngôn ngữ tự nhiên của ChatGPT.

Google đã bắt đầu nâng cấp Gemini để hoạt động theo cách đó, Apple được đồn đại là đang xây dựng một phiên bản Siri mới với chức năng mô hình ngôn ngữ lớn và Amazon đã thử nghiệm Alexa Plus với các kỹ năng cơ bản tương tự.

OpenAI có thể cung cấp Voice Engine để hỗ trợ các hệ thống như vậy trong tương lai hoặc dưới dạng giao diện thay thế cho ChatGPT có thể chạy trên loa thông minh, điện thoại hoặc thậm chí cả tai nghe.

Hoặc có thể chỉ là OpenAI đang chơi trò thận trọng với nhãn hiệu. Nó đã bị từ chối nỗ lực bảo vệ GPT, vì vậy hiện tại nó đã nộp đơn đăng ký nhãn hiệu cho GPT-5, 6 và thậm chí cả GPT-7. Phần sau bao gồm tạo nhạc, chuyển đổi văn bản và dữ liệu thành mã và viết mã từ đầu.

  • VLOGGER AI mới của Google cho phép bạn tạo hình đại diện sống động như thật chỉ từ một bức ảnh
  • Apple có thể đưa Google Gemini lên iPhone để thực hiện các tác vụ AI
  • Tôi đưa cho Claude, ChatGPT và Gemini một bức ảnh các nguyên liệu để xem nguyên liệu nào có công thức ngon nhất
Chia sẻ bài viết này
Theo dõi
Jugo Mobile is a platform dedicated to high-quality content in gaming, sports, and tech. Engage with high-quality content and connect with fellow enthusiasts and experts. Explore the latest trends and innovations in our vibrant community. Join us and experience the future today!