انواع کلیپ های بازخوانی ترانه های مشهور و کلاسیک ایران ادعا می کنند که با هوش مصنوعی ساخته شده اند و حتی صدای خواننده هم را ادعا می کنند صدای تولیدی هوش مصنوعی است فقط نمی دانم چرا این هوش مصنوعی در همه موارد لهجه افغانی/تاجیکی دارد و غلط هم می خواند، چرا لهجه ترکی، کردی، جنوبی ، شمالی بلوچی یا لهجه های دیگر نیست؟ کی خلاف می گوید و کلک چیست؟
مشاهده و دقت شما بسیار بهجا و کاملاً درست است! اینکه چرا بیشتر این بازخوانیها و ترانههای بهظاهر «تولیدی با هوش مصنوعی» لحن و لهجهی افغانستانی (یا نزدیک به تاجیکی/شرقی) دارند و پراشتباه میخوانند، به یک شگرد تبلیغاتی و فنی (کَلَک) برمیگردد.
در واقع در این پدیدهها دو ادعای مجزا وجود دارد که یکی از آنها راست و دیگری نوعی بزرگنمایی و فریب (بلوف تبلیغاتی) است.
۱. کلک اصلی چیست و کی دروغ میگوید؟
ادعای اینکه «صفر تا صد ترانه، آهنگ، شعر و ملودی خواندن را هوش مصنوعی به تنهایی و خودکار تولید کرده» دروغ یا حداقل اغراقآمیز است.
کَلَک کار در نحوهٔ کارکرد ابزارهای واقعی هوش مصنوعی (مثل مدلهای Voice Conversion یا تبدیل صدا مانند RVC) نهفته است:
طرز کار واقعی هوش مصنوعی: هوش مصنوعی در حال حاضر نمیتواند از صفر یک حس انسانیِ تحریر، لحن و ضربآهنگ موزون فارسی بسازد. برای اینکه یک صدای شباهتسازیشده (مثلاً صدای داریوش یا هایده) بخواند، حتماً یک «خوانندهٔ انسانی واقعی» باید ابتدا آن آهنگ را روی میکروفون بخواند (به عنوان الگوی اولیه یا Guide Voice).
نقش هوش مصنوعی: سپس ابزار هوش مصنوعی فقط پوشش و جنس صدای (Timbre) خوانندهٔ واقعی را بر میدارد و روی صدای آن خوانندهٔ اولیه میاندازد (مثل یک فیلتر یا ماسک صوتی).
۲. چرا لهجهی همه آنها افغانستانی است؟
پاسخ ساده است: خوانندهٔ پشت صحنه (الگو) یک انسان افغانستانی است!
از آنجا که بسیاری از تولیدکنندگان این محتواها در شبکههای اجتماعی (یوتیوب، تیکتاک و اینستاگرام) یا تولیدکنندگان محتوای آماتور، از عزیزان افغانستانی هستند یا از خوانندگان و صداپیشگان افغانستانی برای ضبط الگوی اولیه استفاده میکنند:
هوش مصنوعی لحن، لهجه، تلفظ غلط و مخرج حروف را تغییر نمیدهد؛ بلکه فقط «تن صدا» را عوض میکند!
اگر خوانندهٔ اولیه که جلوی میکروفون خوانده، کلمهای را با لهجهی دری یا لهجهی محلی بخواند یا اشتباه تلفظ کند، هوش مصنوعی دقیقاً همان لهجه و همان غلط تلفظی را با صدای «خوانندهٔ مشهور» بازسازی میکند.
به همین دلیل است که صدای هوش مصنوعی هم لهجهی افغانستانی میگیرد و هم غلط میخواند.
۳. چرا لهجهی ترکی، کردی، بلوچی یا غربی نیست؟
اگر یک خوانندهٔ آذریزبان یا کردزبان جلوی میکروفون بنشیند و آن الگوی اولیه را بخواند و سپس مدل هوش مصنوعیِ هایده یا معین را روی آن پیاده کنند، حاصل کار دقیقاً لهجهی ترکی یا کردی خواهد داشت!
دلیل اینکه لهجههای دیگر را کمتر میشنوید فقط یک چیز است: کاربران و تولیدکنندگانی که فعلاً این ابزارها را فراگیر کردهاند و این ویدیوها را تولید میکنند، عمدتاً این فرایند را انجام دادهاند. اگر فردا موجی از کاربرانِ منطقهٔ دیگری این کار را کنند، لهجهی تولیدات هم عوض خواهد شد.
جمعبندی: چه کسی راست میگوید؟
راست داستان: ابزارهای هوش مصنوعی واقعاً میتوانند «جنس و رنگ صدای» یک خواننده را با دقت بالا شبیهسازی کنند.
دروغ/کلک داستان: این ویدیوها «صفر تا صد زاییدهٔ هوش مصنوعی» نیستند؛ بلکه یک خوانندهٔ واقعی انسانی (که لهجهی خاص خود را دارد و ممکن است شعر را غلط بخواند) پشت میکروفون خوانده و هوش مصنوعی صرفاً مانند یک فیلتر تصویری، چهرۂ صوتی او را تغییر داده است.
