پرش به محتوای اصلی

وقتی ماشین ها شروع به صحبت کردن می کنند چه اتفاقی برای زبان می افتد؟

فیزیک‌ارگ۱۴۰۵ مهر ۱۶, پنجشنبه، ساعت ۲۰:۳۰حدود 5 دقیقه مطالعه

چند ماه پیش یکی از دوستان مطلبی را در شبکه های اجتماعی منتشر کرد که توجه من را به خود جلب کرد. او برای گوش دادن به آنچه که «صداهای هوش مصنوعی (به معنای واقعی کلمه) نفس‌گیر برای کتاب‌های صوتی» نامید، تلاش کرد.

ویرایش شده توسط گابی کلارک، بررسی توسط اندرو زینین

این مقاله با توجه به روند و سیاست‌های ویرایشی Science X بررسی شده است. ویراستاران ضمن اطمینان از اعتبار محتوا، ویژگی های زیر را برجسته کرده اند:

چند ماه پیش یکی از دوستان مطلبی را در شبکه های اجتماعی منتشر کرد که توجه من را به خود جلب کرد. او برای گوش دادن به آنچه که «صداهای هوش مصنوعی (به معنای واقعی کلمه) نفس‌گیر برای کتاب‌های صوتی» نامید، تلاش کرد.

وقتی از او پرسیدم که چه قسمتی برایش بدتر از همه بود، گفت که باید گوش دادن را متوقف کند زیرا تنفس طبیعی یا تغییری وجود ندارد - خیلی فرمولی بود.

این ممکن است یک شکایت کوچک به نظر برسد. اما به یک سوال بسیار بزرگتر در مورد زبان و هوش مصنوعی اشاره می کند: چه اتفاقی می افتد وقتی سیستم هایی را برای تولید زبان طراحی می کنیم بدون اینکه توجه کافی به افرادی که به آن گوش می دهند یا آن را می خوانند داشته باشیم؟

ارتباط با گوینده آغاز و پایان نمی یابد. شنوندگان به همان اندازه سخت کار می‌کنند: توجه کردن نه فقط به آنچه که کسی می‌گوید، بلکه به نحوه بیان آن‌ها، آنچه که اخیرا اتفاق افتاده است و آنچه ما انتظار داریم ممکن است در آینده اتفاق بیفتد. حتی آنچه ما به عنوان نقص در گفتار در نظر می گیریم می تواند حاوی اطلاعات باشد.

زبان شناسان اغلب از کلمه "ناروانی" برای اشاره به تردیدها، تکرارها، شروع های نادرست و سایر انحرافات از گفتار "روان" استفاده می کنند.

برچسب می تواند آنها را مانند نقص هایی ایجاد کند که باید حذف شوند. اما در گفتگوی انسانی، آنها بخشی از پیام هستند.

یک صدای مصنوعی که ناهماهنگی را از بین می برد، ممکن است از نظر گرامری دقیق و از نظر آکوستیک بی عیب و نقص باشد، اما در عین حال برای شنونده، که به سادگی کار کمتری دارد، احساس ضعف می کند.

زبان در ذهن ما صرفا به عنوان فهرستی از کلمات و نحوه تلفظ و استفاده از آنها وجود ندارد. این با حافظه، تجربه و دانش ما از جهان درگیر است، که بر اساس جایی که بزرگ شده ایم، با چه کسی، چه کاری و برای چه هدفی انجام می دهیم، شکل می گیرد.

آرونداتی روی، نویسنده برنده جایزه، چیزی از این موضوع را در خاطراتش «مادر مریم نزد من می‌آید» به تصویر می‌کشد، زمانی که بسیاری از ما را به عنوان «یک سوپ زنده و نفس‌گیر از خاطره و تخیل» توصیف می‌کند.

عبارت روی برای تفکر در مورد زبان مفید است، زیرا ارتباط انسانی انتقال پاک اطلاعات از یک ظرف شناختی به ظرف دیگر نیست. کلمات با خاطرات، انتظارات و پیش فرض های شخص دیگری مواجه می شوند. آن‌ها همچنین با زبان‌های دیگر شنونده و همچنین مسائل کمتر قابل حلی مانند احساس آن روز مواجه می‌شوند.

این یکی از دلایلی است که دو نفر می توانند یک جمله را بشنوند و آن را متفاوت درک کنند، و اینکه چرا طنز بسیار ظریف است. همچنین به همین دلیل است که ویژگی های اجتماعی یک صدا اهمیت دارد.

تحقیقات نیکول هالیدی، زبان‌شناس برکلی، نشان می‌دهد که چگونه شنوندگان درباره صداها، از جمله صداهای هوش مصنوعی، قضاوت اجتماعی می‌کنند و چگونه این قضاوت‌ها با درک شخصیت و هویت تعامل دارند. شنونده برای ارتباط بسیار مهم است و این مشکل جالبی برای هوش مصنوعی مولد ایجاد می کند.

بیشتر توسعه هوش مصنوعی مولد بر توانایی سیستم برای تولید زبان متمرکز شده است. به کسانی که به آن گوش می دهند توجه کمتری شده است.

این مهم است زیرا سیستم های هوش مصنوعی مولد به موجودیت های جدیدی تبدیل شده اند که ما با آنها ارتباط برقرار می کنیم.

اگر هر روز ساعت‌ها به پرسش‌های پلتفرم هوش مصنوعی، تهیه پیش‌نویس ایمیل یا صحبت با دستیاران صوتی بپردازیم، در نوع جدیدی از محیط ارتباطی شرکت می‌کنیم و انسان‌ها در سازگاری با محیط‌های جدید مهارت دارند.

بسیاری از شرکت‌های فناوری در حال حاضر سعی می‌کنند صداهای مصنوعی را کمتر مکانیکی به نظر برسانند، و ناهماهنگی‌ها و نشانگرهای مکالمه‌ای را که از تعامل انسانی به دست می‌آیند، معرفی می‌کنند.

همانطور که روباتیک توسعه می یابد و تعامل با ماشین ها عادی می شود، صداهای مصنوعی ممکن است ریتم و عروض قانع کننده تری پیدا کنند. آنها ممکن است تشخیص دهند که چه زمانی یک شنونده نیاز به توضیح دارد، چه زمانی یک شوخی نیاز به مکث دارد یا زمانی که عدم اطمینان یک گوینده باید در ارائه او نمایان شود.

از طرف دیگر، ویژگی‌های مکانیکی - صدای "بدون نفس" دوستم، پاسخ کاملا ساختار یافته، عدم تردید - ممکن است صدای یک مدل هوش مصنوعی مولد را تعریف کند: یک امضای زبانی که به عنوان نوعی واترمارک عمل می‌کند. ما ممکن است اینها را به عنوان نقص تلقی نکنیم و شروع به برخورد با آنها به عنوان یک ثبت کنیم.

یک پیشرفت به خصوص جالب این است که وقتی سیستم های مصنوعی با یکدیگر صحبت می کنند اتفاق می افتد. در سپتامبر 2026، تحقیقات نشان داد که عوامل هوش مصنوعی مستقل واژگان، استعاره ها و عبارات رمزگذاری شده غیرمعمول را در محیط های آزمایشی توسعه داده اند. محققان تفسیر زبان حاصل را برای انسان دشوار توصیف کردند و آن را با ظهور زبان نوآورانه در جوامع انسانی مقایسه کردند.

زبان در طول تاریخ توسط تعامل بین انسان ها شکل گرفته است. جوامع راه‌های جدیدی را برای گفتن یا امضا کردن چیزها ایجاد می‌کنند، مردم عبارات را از یکدیگر قرض می‌گیرند، آنها را اشتباه می‌فهمند، آنها را تغییر شکل می‌دهند و به آنها منتقل می‌کنند.

حالا یک نوع دیگر از شرکت کننده در آن محیط وجود دارد. سیستم‌های مصنوعی می‌توانند زبان تولید کنند، آن را مصرف کنند و با سایر سیستم‌های مصنوعی در مقیاس و سرعتی که انسان‌ها نمی‌توانند با آن برابری کنند تعامل داشته باشند.

بازگشت به شکایت دوستم: آیا اصلا هوش مصنوعی باید انسان به نظر برسد؟

اگر صداهای مصنوعی ویژگی‌های قابل شناسایی را حفظ کنند، شنوندگان می‌دانند که با یک ماشین سروکار دارند – و دانستن آن ممکن است ارزش داشته باشد. اما بدیهی است که ساختن صدای مصنوعی همه مشکلات را حل نمی کند.

یک صدای مصنوعی می تواند به طور قابل تشخیصی مصنوعی به نظر برسد در حالی که هنوز کلیشه های اجتماعی یا فرضیات محدودی در مورد اینکه یک نوع خاص از گوینده باید چگونه باشد، بازتولید می کند.

پس سوال فقط این نیست که آیا هوش مصنوعی به نظر انسان می رسد یا خیر. همچنین این است که ماشین برای نشان دادن چه نوع زبان انسانی آموزش دیده است، زبان آن به عنوان الگو به حساب می‌آید و برای هر چیزی که خارج از آن است، از جمله صدای گروه‌های اقلیت‌شده چه اتفاقی می‌افتد. شنونده باید در مرکز آن طراحی قرار گیرد.

آینده هوش مصنوعی – و زبان – به این بستگی دارد که انسان‌ها چگونه به زبانی که ماشین‌ها تولید می‌کنند واکنش نشان می‌دهند و چگونه تعاملات بین انسان‌ها و ماشین‌ها به شکل‌گیری ارتباطات ادامه می‌دهد. فقط زمان مشخص خواهد کرد.

کارشناسی ارشد زبان انگلیسی، ویرایشگر کپی از سال 2021 با تجربه در آموزش عالی و محتوای بهداشتی. تقدیم به اخبار معتبر علمی. نمایه کامل →

فوق لیسانس فیزیک با تجربه تحقیق. علاقه مندان به اخبار علمی طولانی مدت. نقش کلیدی در موفقیت سرمقاله Science X ایفا می کند. نمایه کامل →

این مقاله با مجوز Creative Commons از The Conversation بازنشر شده است. مقاله اصلی را بخوانید.

خواندن متن کامل در فیزیک‌ارگبه زبان اصلی، در سایت ناشر باز می‌شود
متن اصلی (انگلیسی)

What happens to language when machines start talking back?

A few months ago, a friend posted something that caught my eye on social media. She struggled to listen to what she termed "(literally) breathless AI voices for audiobooks."

همه‌ی اخبار فناوری