۱۴۰۵ مرداد ۱۲, دوشنبه

 انواع کلیپ های بازخوانی ترانه های مشهور و کلاسیک ایران  ادعا می کنند که با هوش مصنوعی ساخته شده اند و حتی صدای خواننده هم را ادعا می کنند صدای تولیدی هوش مصنوعی است فقط نمی دانم چرا این هوش مصنوعی در همه موارد لهجه افغانی/تاجیکی دارد و غلط هم می خواند، چرا لهجه ترکی، کردی، جنوبی ، شمالی بلوچی یا لهجه های دیگر نیست؟ کی خلاف می گوید و کلک چیست؟

مشاهده و دقت شما بسیار به‌جا و کاملاً درست است! اینکه چرا بیشتر این بازخوانی‌ها و ترانه‌های به‌ظاهر «تولیدی با هوش مصنوعی» لحن و لهجه‌ی افغانستانی (یا نزدیک به تاجیکی/شرقی) دارند و پراشتباه می‌خوانند، به یک شگرد تبلیغاتی و فنی (کَلَک) برمی‌گردد.

در واقع در این پدیده‌ها دو ادعای مجزا وجود دارد که یکی از آن‌ها راست و دیگری نوعی بزرگ‌نمایی و فریب (بلوف تبلیغاتی) است.

۱. کلک اصلی چیست و کی دروغ می‌گوید؟

ادعای اینکه «صفر تا صد ترانه، آهنگ، شعر و ملودی خواندن را هوش مصنوعی به تنهایی و خودکار تولید کرده» دروغ یا حداقل اغراق‌آمیز است.

کَلَک کار در نحوهٔ کارکرد ابزارهای واقعی هوش مصنوعی (مثل مدل‌های Voice Conversion یا تبدیل صدا مانند RVC) نهفته است:

  1. طرز کار واقعی هوش مصنوعی: هوش مصنوعی در حال حاضر نمی‌تواند از صفر یک حس انسانیِ تحریر، لحن و ضرب‌آهنگ موزون فارسی بسازد. برای اینکه یک صدای شباهت‌سازی‌شده (مثلاً صدای داریوش یا هایده) بخواند، حتماً یک «خوانندهٔ انسانی واقعی» باید ابتدا آن آهنگ را روی میکروفون بخواند (به عنوان الگوی اولیه یا Guide Voice).

  2. نقش هوش مصنوعی: سپس ابزار هوش مصنوعی فقط پوشش و جنس صدای (Timbre) خوانندهٔ واقعی را بر می‌دارد و روی صدای آن خوانندهٔ اولیه‌ می‌اندازد (مثل یک فیلتر یا ماسک صوتی).

۲. چرا لهجه‌ی همه آن‌ها افغانستانی است؟

پاسخ ساده است: خوانندهٔ پشت صحنه (الگو) یک انسان افغانستانی است!

از آنجا که بسیاری از تولیدکنندگان این محتواها در شبکه‌های اجتماعی (یوتیوب، تیک‌تاک و اینستاگرام) یا تولیدکنندگان محتوای آماتور، از عزیزان افغانستانی هستند یا از خوانندگان و صداپیشگان افغانستانی برای ضبط الگوی اولیه استفاده می‌کنند:

  • هوش مصنوعی لحن، لهجه، تلفظ غلط و مخرج حروف را تغییر نمی‌دهد؛ بلکه فقط «تن صدا» را عوض می‌کند!

  • اگر خوانندهٔ اولیه که جلوی میکروفون خوانده، کلمه‌ای را با لهجه‌ی دری یا لهجه‌ی محلی بخواند یا اشتباه تلفظ کند، هوش مصنوعی دقیقاً همان لهجه و همان غلط تلفظی را با صدای «خوانندهٔ مشهور» بازسازی می‌کند.

  • به همین دلیل است که صدای هوش مصنوعی هم لهجه‌ی افغانستانی می‌گیرد و هم غلط می‌خواند.

۳. چرا لهجه‌ی ترکی، کردی، بلوچی یا غربی نیست؟

اگر یک خوانندهٔ آذری‌زبان یا کردزبان جلوی میکروفون بنشیند و آن الگوی اولیه را بخواند و سپس مدل هوش مصنوعیِ هایده یا معین را روی آن پیاده کنند، حاصل کار دقیقاً لهجه‌ی ترکی یا کردی خواهد داشت!

دلیل اینکه لهجه‌های دیگر را کمتر می‌شنوید فقط یک چیز است: کاربران و تولیدکنندگانی که فعلاً این ابزارها را فراگیر کرده‌اند و این ویدیوها را تولید می‌کنند، عمدتاً این فرایند را انجام داده‌اند. اگر فردا موجی از کاربرانِ منطقهٔ دیگری این کار را کنند، لهجه‌ی تولیدات هم عوض خواهد شد.

جمع‌بندی: چه کسی راست می‌گوید؟

  • راست داستان: ابزارهای هوش مصنوعی واقعاً می‌توانند «جنس و رنگ صدای» یک خواننده را با دقت بالا شبیه‌سازی کنند.

  • دروغ/کلک داستان: این ویدیوها «صفر تا صد زاییدهٔ هوش مصنوعی» نیستند؛ بلکه یک خوانندهٔ واقعی انسانی (که لهجه‌ی خاص خود را دارد و ممکن است شعر را غلط بخواند) پشت میکروفون خوانده و هوش مصنوعی صرفاً مانند یک فیلتر تصویری، چهرۂ صوتی او را تغییر داده است.