Google đã ra mắt sản phẩm trí tuệ nhân tạo mới tại sự kiện Google I/O vào thứ Ba -Gemini Live. Tất cả chúng tôi đều cho rằng đó là những gì Trợ lý Song Tử trong Android phải làm nhưng đây là Google và mọi thứ đều ổn.
Nếu không phải vì nó diễn ra chỉ một ngày sau sự kiện sản phẩm tiêu dùng đầu tiên của OpenAI, tôi sẽ suy nghĩ xem liệu Gemini Live có được ra mắt để cạnh tranh với ChatGPT Voice hay không. Cả hai đều được xây dựng bằng mô hình AI đa phương thức nguyên bản và có khả năng thoại và video ấn tượng.
Hiện tại trong cuộc đua AI toàn cầu, những người dẫn đầu dường như là OpenAI và Google, trong đó OpenAI và Google dường như đang thân thiện với Apple và iPhone còn OpenAI đang kiểm soát Android. Hãy quên các thiết bị AI như Rabbit r1 hay Humane Pin đi – người chiến thắng trong ngắn hạn là điện thoại thông minh.
Cả ChatGPT Voice và Gemini Live đều đang được tích hợp vào một sản phẩm AI hiện có và cả hai đều chưa có sẵn hiện nay — nhưng những trợ lý thế hệ tiếp theo này có gì khác để so sánh?
Gemini Live và ChatGPT 4o so sánh như thế nào?
Google đang gặp khó khăn một chút khi nói đến độ tin cậy, đặc biệt là về việc thể hiện khả năng phân tích video trực tiếp và giọng nói. Khi công bố Gemini Ultra vào năm ngoái, họ đã làm như vậy với một đoạn video cho thấy nó phản hồi video thời gian thực – chỉ có điều đó không phải là video thời gian thực hay video.
Tuy nhiên, lần này họ đã đưa ra quan điểm là cung cấp công nghệ này, ít nhất là khía cạnh “Project Astra” cơ bản của nó, bao gồm cả cuộc trò chuyện bằng giọng nói và video để dùng thử tại I/O.
Cả hai đều cung cấp giao diện giọng nói ngôn ngữ tự nhiên, đàm thoại, cả hai đều có khả năng phân tích video trực tiếp thông qua camera trên điện thoại thông minh và cả hai đều dường như đủ nhanh để có một cuộc trò chuyện thực sự tự nhiên, nơi bạn có thể làm gián đoạn luồng AI giữa chừng.
Tuy nhiên, có một số khác biệt đáng chú ý. Giọng nói ChatGPT của OpenAI nghe có vẻ tự nhiên hơn, có thể phát hiện và phản hồi cảm xúc cũng như âm sắc giọng nói, thậm chí thích ứng theo thời gian thực với cách bạn yêu cầu nói. Tôi không thấy bằng chứng về khả năng đó từ Gemini Live.
Sự khác biệt lớn khác là xung quanh đa phương thức. Gemini vẫn dựa vào các mô hình đầu ra khác bao gồm sử dụng Imagen 3 cho hình ảnh và Veo cho video. GPT-4o vốn có tính đa phương thức theo cả hai hướng — chữ o là viết tắt của omni hoặc theo mọi hướng. Nó tạo ra hình ảnh và âm thanh của riêng mình.
Gemini Live vs GPT-4o: Tương lai của trợ lý giọng nói

Thế giới dường như đang hướng tới giọng nói và tránh xa việc nhập văn bản. Khi tôi xem thông báo OpenAI lần đầu tiên, phản ứng của tôi là đây là một sự thay đổi mô hình trong giao diện người-máy tính, một sự thay đổi lớn như việc ra mắt chuột hoặc màn hình cảm ứng.
Tôi vẫn giữ quan điểm đó và thực tế là Google cũng đang tung ra giao diện giọng nói tự nhiên, tự nhiên càng củng cố thêm điều đó. Ngay cả Meta cũng có MetaAI, một bot giọng nói có sẵn trong tai nghe VR và kính thông minh Ray-Ban.
Mặc dù hiện tại điện thoại thông minh có thể là người chiến thắng, nhưng rõ ràng yếu tố hình thức thực sự của các mẫu AI giọng nói này là kính thông minh. Có sẵn các camera ngang tầm mắt và cánh tay để gửi sóng âm thanh đến tai bạn — chúng là thiết bị AI hoàn hảo.
Câu hỏi đặt ra là liệu OpenAI có chuyển sang lĩnh vực phần cứng, tung ra cặp kính thông minh của riêng mình hay đây là Siri mới và sẽ cung cấp năng lượng cho sản phẩm Kính Apple trong tương lai. Ngoài ra, liệu Google có thực sự đủ dũng cảm để hồi sinh Google Glass hay không.
- ChatGPT với GPT-4o – Tôi không thể nhớ lần cuối cùng tôi bị choáng ngợp bởi một phần công nghệ là khi nào
- Google vừa trả lời GPT-4o với bản demo Gemini mang tính trò chuyện và sử dụng video
- OpenAI GPT-4o hiện đang được triển khai — đây là cách để có quyền truy cập