Alexandru Voica, người đứng đầu bộ phận đối ngoại tại Synthesia, đã giới thiệu một thành viên mới trong đội ngũ truyền thông của mình: một bản sao kỹ thuật số tương tác. Thay vì trực tiếp trả lời các câu hỏi thường gặp từ báo chí, Voica gửi một đường liên kết dẫn đến phiên bản ảo của chính mình, nơi nó được huấn luyện để giải thích về cách thức hoạt động của công ty. Với định giá đạt 4 tỷ USD và doanh thu định kỳ hàng năm vượt mốc 100 triệu USD, Synthesia đang chuyển mình từ việc tạo ra các video tĩnh sang những thực thể AI có khả năng phản hồi trực tiếp. Công nghệ này không chỉ dừng lại ở việc đọc kịch bản có sẵn mà đã tiến tới sản phẩm Roleplay Sessions, cho phép nhân viên rèn luyện kỹ năng bán hàng hoặc thuyết trình thông qua việc đối thoại và nhận điểm đánh giá từ avatar.
Thử nghiệm thực tế với phóng viên Dominic-Madori Davis cho thấy quy trình tạo ra bản sao này đòi hỏi sự chuẩn bị kỹ lưỡng tại studio với các yêu cầu nghiêm ngặt về sự đồng thuận và dữ liệu giọng nói. Kết quả là những phiên bản ảo có thể tùy chỉnh diện mạo, sở hữu khả năng lắng nghe và trò chuyện dựa trên những tài liệu cụ thể được cung cấp trước đó. Đây là lần đầu tiên công ty tạo ra một bản sao kỹ thuật số cho một cá nhân ngoài đội ngũ nội bộ, đánh dấu bước tiến trong việc cá nhân hóa trải nghiệm AI.
Quy trình xây dựng và cơ chế vận hành của bản sao kỹ thuật số
Để tạo ra một bản sao hoàn chỉnh, người dùng cần trải qua quá trình ghi hình và thu âm trực tiếp trong khoảng hai phút để hệ thống thu thập dữ liệu về diện mạo và âm sắc. Hệ thống kỹ thuật đằng sau là sự kết hợp phức tạp giữa các mô hình chuyển đổi giọng nói thành văn bản, mô hình ngôn ngữ tác nhân (agentic language model) để xử lý ý nghĩa, và cuối cùng là mô hình video của Synthesia để hoạt hóa cử động khuôn mặt. Điểm khác biệt lớn nhất nằm ở tính xác định (deterministic) của các avatar tương tác; chúng chỉ trả lời dựa trên lượng kiến thức được huấn luyện, chẳng hạn như một bài báo cụ thể, và sẽ từ chối hoặc chuyển hướng nếu gặp các câu hỏi ngoài lề về đời tư hay thông tin không liên quan.
Người dùng có quyền tùy chọn sử dụng các mô hình giọng nói từ những đơn vị khác như ElevenLabs, Google hoặc OpenAI, đồng thời tự quyết định nền tảng lưu trữ đám mây để đảm bảo tính bảo mật. Hiện tại, Synthesia cung cấp ba dòng sản phẩm chính: nền tảng tạo video truyền thống từ kịch bản, hệ thống Sessions để tương tác nhập vai trong khảo sát hoặc đào tạo, và bộ API dành cho các doanh nghiệp muốn tích hợp mô hình video vào dịch vụ riêng. Mặc dù công nghệ này mang lại sự tiện lợi trong việc phản hồi thông tin liên tục, cảm giác “thung lũng kỳ lạ” (uncanny valley) vẫn tồn tại khi người đối diện quan sát những cử động nhỏ hoặc chờ đợi phản ứng từ một thực thể ảo vốn không có cảm xúc thực thụ.
Việc ứng dụng bản sao kỹ thuật số trong môi trường chuyên nghiệp giúp tối ưu hóa thời gian phản hồi nhưng cũng đặt ra bài toán về lòng tin. Trong khi thế hệ trẻ có thể coi đây là một trải nghiệm mang tính khoa học viễn tưởng thú vị, việc sử dụng avatar để thay thế con người trong các lĩnh vực nhạy cảm như báo chí vẫn nhận về nhiều ý kiến trái chiều.
Sự xuất hiện của các bản sao kỹ thuật số đặt ra những câu hỏi quan trọng về tính xác thực trong giao tiếp hiện đại. Dù AI có thể hỗ trợ con người trong việc truyền tải thông tin lặp đi lặp lại hoặc rèn luyện kỹ năng chuyên môn, yếu tố cốt lõi về sự kết nối thực thụ vẫn là rào cản lớn nhất. Các doanh nghiệp nên cân nhắc áp dụng công nghệ này như một công cụ tăng cường hiệu suất tại các bộ phận chăm sóc khách hàng hoặc đào tạo nội bộ, đồng thời cần duy trì sự minh bạch để đảm bảo rằng người dùng luôn biết họ đang tương tác với một thực thể nhân tạo.


Liên hệ qua Zalo