Vào ngày 4 tháng 9, Google đã tích hợp Lyria 3.5 vào ứng dụng Gemini và Gemini API. Đối với người dùng thông thường, đây là một bản cập nhật rất trực quan: mô tả phong cách âm nhạc bạn muốn, chọn có giọng hát hay thuần nhạc cụ, rồi quyết định tạo một đoạn nhạc ngắn hay một bản nhạc dài đầy đủ, hệ thống sẽ tạo ra sản phẩm hoàn chỉnh. Đối với các nhà phát triển và nhà sáng tạo, sự thay đổi cụ thể hơn — cùng mô hình này đã được tích hợp vào Google AI Studio, Google Vids và Flow Music, nghĩa là âm nhạc AI không còn chỉ là một tính năng thử nghiệm trên trang web, mà đang dần hòa nhập vào các quy trình làm việc hiện có như sản xuất video, nội dung thương hiệu và phát triển ứng dụng.
Điểm đáng chú ý nhất trong thông báo này không phải là “lại thêm một mô hình âm nhạc”, mà là Google bắt đầu biến việc tạo âm nhạc thành một năng lực sản phẩm có thể giao giao. Chính thức, Google tóm tắt các điểm nâng cấp là giọng hát giàu biểu cảm, dàn xếp phong phú hơn và chất lượng âm thanh cao hơn, đồng thời cung cấp lựa chọn phong cách và mẫu. Trước đây, nhiều công cụ tạo âm nhạc có thể tạo ra giai điệu nhanh chóng, nhưng thường để lộ dấu vết máy móc trong cấu trúc hoàn chỉnh, chất lượng giọng hát và sự phát triển đoạn nhạc. Lyria 3.5 rõ ràng nhắm vào “km cuối cùng”: giúp người dùng giảm thiểu thử nghiệm từ khóa, đồng thời nhận được nhiều tài nguyên có thể sử dụng trực tiếp trong video, nhạc chuông hoặc nội dung thương hiệu.
Từ đồ chơi truyền cảm hứng đến công cụ sản xuất nội dung
Việc tích hợp sinh âm thanh vào quy trình làm việc thực sự dựa vào sự ổn định, kiểm soát được và tiết kiệm thời gian, chứ không phải chỉ một lần nghe ấn tượng. Các đội ngũ video ngắn cần chuyển đổi giữa nhiều phiên bản thời lượng khác nhau, các khách hàng thương hiệu quan tâm đến tính nhất quán về phong cách, còn các nhà phát triển thì quan tâm đến tính ổn định của giao diện và khả năng tích hợp vào sản phẩm. Lyria 3.5 đồng thời hỗ trợ ứng dụng và API của Gemini, đáp ứng đúng hai đầu: sáng tạo cá nhân và sản xuất quy mô lớn. Người dùng cá nhân có thể bắt đầu nhanh chóng với các mẫu có sẵn, trong khi các nhà phát triển có thể tích hợp khả năng này vào các sản phẩm chỉnh sửa, tiếp thị hoặc giải trí tương tác của riêng họ.
Google cũng liệt kê “bài hát ngắn hoặc dài hơn” như một khả năng độc lập. Dù nghe có vẻ bình thường, nhưng thực chất đây là một trong những thách thức lớn nhất trong việc tạo nhạc sinh thành: khi tăng độ dài, mô hình không chỉ phải duy trì chất âm mà còn phải xử lý các phần như đoạn verse, chorus, bridge và sự thay đổi cảm xúc, đồng thời tránh lặp lại máy móc. Thông báo không tiết lộ độ dài tối đa thống nhất, sự khác biệt theo khu vực hay toàn bộ thông số kỹ thuật, do đó, cách diễn đạt chính xác hơn là người dùng có được sự linh hoạt hơn trong lựa chọn độ dài, chứ không phải khả năng tạo ra toàn bộ album một cách vô hạn.
So với văn bản và hình ảnh, âm nhạc còn có thêm một lớp ranh giới sử dụng. Liệu một giai điệu có quá giống với các tác phẩm đã có, giọng hát có khiến khán giả nhầm tưởng là ca sĩ thật, hay các dự án thương mại có thể sử dụng theo điều khoản của nền tảng — đều là những vấn đề mà nhà sáng tạo phải tự kiểm tra. Thông báo lần này của Google tập trung vào khả năng sản phẩm và không “giải quyết” đồng thời những vấn đề phức tạp này. Do đó, đội ngũ vẫn nên lưu giữ các prompt, phiên bản được tạo ra và hồ sơ chỉnh sửa thủ công trước khi giao hàng chính thức, đồng thời rà soát lại các giai điệu, lời bài hát và mức độ tương đồng âm thanh có nguy cơ cao.
Đối với ngành nội dung, sản phẩm này có thể thay đổi trước tiên không phải là sáng tác của những nghệ sĩ âm nhạc hàng đầu, mà là những nhu cầu hàng ngày vốn trước đây không đủ khả năng chi trả cho nhạc tùy chỉnh. Các đoạn mở đầu podcast, video cửa hàng, nền nhạc cho khóa học, trang sự kiện game và quảng cáo mạng xã hội đều cần lượng lớn nhạc, thời gian gấp rút và ngân sách hạn chế. Trước đây, chúng thường dựa vào thư viện nhạc phổ thông; bây giờ, các nhà sáng tạo có thể tạo ra các phiên bản phù hợp hơn dựa trên hình ảnh và nhịp điệu cụ thể. Giá trị không nhất thiết đến từ việc “tốt hơn nhạc sĩ chuyên nghiệp”, mà đến từ việc mang đến cho mỗi nội dung một âm thanh gần với tùy chỉnh hơn.
Sự cạnh tranh thực sự nằm ở phân phối và quản lý bản quyền
Việc đưa Lyria 3.5 vào Gemini, thay vì chỉ giữ lại như một sản phẩm phòng thí nghiệm độc lập, quan trọng hơn nhiều so với các chỉ số đơn lẻ. Gemini sở hữu lối vào người dùng sẵn có, kết nối với Google Vids để xử lý video văn phòng, dịch vụ AI Studio phục vụ nhà phát triển, và Flow Music hướng đến những nhà sáng tạo chuyên sâu hơn. Khả năng của mô hình được phân phối thông qua các lối vào này, giúp người dùng có thể gọi chức năng tạo nhạc trong các tác vụ vốn có mà không cần hiểu trước tên mô hình. Do đó, cuộc cạnh tranh của các sản phẩm AI đã chuyển từ “mẫu nào nghe hay nhất” sang “ai có thể giao sản phẩm nhanh nhất trong bối cảnh đúng”.
Tuy nhiên, càng phân phối rộng rãi thì áp lực quản trị càng lớn. Âm nhạc là loại nội dung có mối quan hệ quyền lợi cực kỳ phức tạp, trong đó lời bài hát, giai điệu, bản ghi âm, hình tượng giọng hát và phong cách biểu diễn có thể tương ứng với các quyền khác nhau. Người dùng doanh nghiệp không thể coi “nền tảng cho phép tạo ra” là tương đương với “có thể sử dụng thương mại trong mọi bối cảnh”. Cách tiếp cận an toàn là trước tiên đọc các điều khoản dịch vụ tương ứng với khu vực và tài khoản hiện tại, sau đó tiến hành kiểm tra thủ công đối với đầu ra cuối cùng; khi liên quan đến nghệ sĩ nổi tiếng, bài hát đã có sẵn hoặc thương hiệu khách hàng, cần áp dụng các tiêu chuẩn nội bộ nghiêm ngặt hơn.
Từ góc độ ngành công nghiệp, Lyria 3.5 mang khả năng tạo nhạc đến với tất cả người dùng và nhà phát triển Gemini toàn cầu, từ đó mở rộng nguồn cung nhạc sinh thành, nhưng không có nghĩa là giá trị của âm nhạc truyền thống bị xóa nhòa. Ngược lại, khi nền tảng nhạc nền trở nên rẻ hơn, những tác phẩm sáng tạo có tính nhận diện cao, biểu đạt nhân vật đáng tin cậy và chuỗi cấp phép rõ ràng có thể trở nên quý giá hơn. Mô hình phù hợp với việc tạo bản nháp, biến thể và nhạc nền rủi ro thấp, trong khi con người mới là người quyết định lý do tồn tại của tác phẩm, cần biểu đạt điều gì và khi nào nên dừng quá trình sinh thành.
Do đó, bản cập nhật này có thể được xem là một bước tiến của Google trong việc thương mại hóa các sản phẩm truyền thông sinh thành: mô hình đã không còn chỉ dừng lại ở các bản trình diễn kỹ thuật vài giây, mà bắt đầu đảm nhận các nhiệm vụ nội dung có thể tích hợp, tái sử dụng và giao giao. Liệu nó có trở thành công cụ phổ biến của người sáng tạo hay không, còn phụ thuộc vào tính nhất quán, chi phí, cơ chế kiểm duyệt và phản hồi người dùng trong các dự án thực tế. Điều chính thức được xác nhận là Lyria 3.5 đã được tích hợp vào các sản phẩm và giao diện liên quan; điều mà thị trường cuối cùng sẽ chấp nhận, là nó đã tiết kiệm được bao nhiêu thời gian và giảm bao nhiêu công việc làm lại trong các quy trình làm việc thực tế.
