Runway, một trong những nền tảng tạo video trí tuệ nhân tạo hàng đầu, đã bổ sung tính năng hát nhép mới vào bộ công cụ đang phát triển của mình và cung cấp tính năng này cho tất cả người dùng.
Khả năng tạo hoạt ảnh chuyển động của miệng và khuôn mặt theo thời gian thành một đoạn âm thanh mang đến một chiều hướng hoàn toàn mới cho video AI, mang đến cho nhân vật giọng nói và khiến họ tương tác.
Pika Labs đã ra mắt tính năng hát nhép vào đầu tháng này và cả hai công cụ đều sử dụng giọng nói tổng hợp có âm thanh tự nhiên ấn tượng từ ElevenLabs.
Việc triển khai mới từ Runway cũng cho phép bạn sao chép giọng nói của chính mình từ bên trong giao diện bằng công nghệ ElevenLabs. Nó được xây dựng dựa trên các tùy chọn tạo âm thanh trước đó và có sẵn trong phần Generative Audio của giao diện Runway cho tất cả người dùng.
Thử nghiệm tính năng hát nhép của Runway
Hát nhép là một tính năng quan trọng để video AI trở nên phổ biến hơn, nhưng để nó hoạt động, nó không chỉ tạo hoạt ảnh cho chuyển động của miệng mà còn cần tạo hoạt ảnh cho khuôn mặt và điều này chỉ làm được điều đó.
Để thử nghiệm, tôi đã tạo một loạt nhân vật quay mặt về phía máy ảnh bằng cách sử dụng Leonardo, được xây dựng trên công nghệ Khuếch tán ổn định. Tôi cũng đã sử dụng tính năng Runway mới với nhân vật tôi tạo bằng tính năng nhân vật nhất quán của MidJourney.
Sau đó, tôi chạy các hình ảnh Leonardo thông qua công cụ Runway Generative Voice với một tập lệnh ngẫu nhiên và giọng nói tổng hợp phù hợp nhất. Đối với hình ảnh MidJourney, tôi đã ghi lại một mẫu giọng nói của chính mình để xem nó xử lý âm thanh thực như thế nào.
Lính cứu hỏa
Nhân vật đầu tiên tôi thử nghiệm là một lính cứu hỏa có vẻ ngoài mạnh mẽ trong bộ đồng phục đầy đủ với phông nền mờ. Chọn một giọng nữ Mỹ mặc định, tôi bảo cô ấy nói về thế giới đang bốc cháy và nhu cầu phải chạy trốn.
Tôi thực sự ấn tượng với khả năng Runway không chỉ bám vào đường viền môi trong hoạt ảnh mà còn có thể di chuyển đầu kịp thời với những gì đang được nói.
Chuyên gia cổ đại
Trong Civilization 2 có một Hội đồng cố vấn cấp cao. Về cơ bản, đó là những video được ghi trước về những người nói chuyện trước máy quay trong trang phục cổ xưa với những dòng về trò chơi bạn đang chơi, chẳng hạn như “chúng tôi cần thêm binh lính”.
Tôi đã tạo ra một nhân vật lấy cảm hứng từ ý tưởng này và nhờ cô ấy nói về cuộc phiêu lưu. Tôi nghĩ giọng nói tôi chọn nhẹ nhàng hơn nhưng tôi nghĩ công cụ này đã làm rất tốt việc tạo hoạt ảnh mô tả nhân vật theo phong cách CGI hơn.
Ông già
Tuổi tác chỉ là một con số nhưng khi chúng ta già đi, khuôn mặt của chúng ta thay đổi, trở nên già nua và sống động hơn – và giọng nói của chúng ta thường trầm hơn. Tôi chọn mô tả gần như thực tế này về một ông già ngồi trên ghế tựa vào máy ảnh.
Đây là một trong những hoạt hình về môi kém thực tế nhất với những chiếc răng nhô ra theo những cách thung lũng hơi kỳ lạ. Nhưng nó vẫn có vẻ khá tốt đối với nội dung do AI tạo ra.
Cuộc thảo luận từ xa
Đây là bài kiểm tra khó khăn nhất đối với AI. Nó phải diễn giải một khuôn mặt ở xa góc nhìn của máy ảnh hơn và không đối diện trực tiếp với máy ảnh.
Runway đã không làm một công việc khủng khiếp; nó thậm chí còn thử một số hoạt ảnh chuyển động đầu nhưng thung lũng kỳ lạ trong đó cao hơn bất kỳ thử nghiệm nào khác của tôi. Chỉ có một nửa miệng là hoạt hình.
Sử dụng giọng nói của chính tôi
Đối với bài kiểm tra này, tôi đã sử dụng hình ảnh chân thực của một nhân vật mà tôi đã tạo trong MidJourney và sau đó sử dụng bản ghi âm giọng nói của chính tôi để hát nhép.
Đây là một bài kiểm tra thành công kép vì nó cũng kiểm tra khả năng đưa râu của Runway qua các bước đi của nó và nó gặp khó khăn nhưng không nhiều như tính năng đồng bộ hóa nhép AI khác mà tôi đã thử. Nó xử lý việc ghi âm giọng nói cũng như xử lý chuyển văn bản thành giọng nói và giọng nói tổng hợp.
Hoạt hình một video
Tất cả các thử nghiệm khác đều sử dụng hình ảnh làm điểm bắt đầu, hoàn toàn dựa vào Runway để thêm bất kỳ chuyển động nào nhằm ngăn chặn cảm giác tĩnh. Bài kiểm tra này bắt đầu bằng một video.
Nó được tạo ra bằng cách sử dụng Leonardo và Motion, cho thấy một người đàn ông lớn tuổi đang nhìn chằm chằm vào khoảng không như thể ông ấy nhìn thấy điều gì đó tuyệt vời. Runway không chỉ tạo hoạt ảnh cho miệng một cách chính xác mà còn khắc phục sự cố với miệng ở thế hệ ban đầu và đồng bộ hóa với giọng nói mà tôi đã chọn. Đây có thể là ấn tượng nhất trong các bài kiểm tra.
Bài kiểm tra hình ảnh hành động
Cuối cùng, tôi thử nghiệm Runway bằng hoạt hình miệng của một nhân vật hành động. Tôi đã chạy thử nghiệm tương tự trên Pika Labs khi nó triển khai tính năng hát nhép và nó đã hoạt động rất tốt, thêm biểu cảm chuyển động của môi một cách hợp lý.
Trong trường hợp này, tôi không nghĩ Runway làm tốt như Pika Labs. Mặc dù đôi môi tự nhiên và chân thực hơn (đối với một món đồ chơi bằng nhựa) và nó di chuyển đầu – điều đó thực sự khiến nó ít hữu ích hơn đối với kiểu nhân vật này.
Tóm lại: Hát nhép trên Runway có tốt không?
Hát nhép và video AI là một lĩnh vực tương đối mới nhưng quan trọng. Nó mang lại cho các nhân vật nhiều … tính cách hơn những gì có thể và cho phép trò chuyện. Nó cũng vẫn còn cảm thấy rất mới.
Cách tiếp cận của Runway rất ấn tượng và thực tế hơn nhiều so với các mô hình tương tự mà tôi đã thử. Nó thực sự gần giống với tính năng đồng bộ hóa môi kỹ thuật số phức tạp và đắt tiền hơn của con người từ Nvidia thường dành cho các nhà phát triển sử dụng.
Nó cũng cho phép bạn tạo các đoạn độc thoại hoặc đoạn hội thoại dài hơn các công cụ khác và với hoạt ảnh chuyển động của đầu – nó mang lại cảm giác chân thực hơn.
- Công cụ video AI tổng hợp mới của Pika Labs đã ra mắt – và nó có vẻ như là một vấn đề lớn
- Tôi đã có quyền truy cập vào công cụ video AI mới của Pika Labs và không thể tin được chất lượng video mà nó tạo ra
- Runway vs Pika Labs – công cụ video AI nào tốt nhất?