تیتربرتر: پروژهی گفتار چندزبانه (MMS) غول رسانههای اجتماعی میتواند بیش از چهار هزار زبان را تشخیص و عملیات تبدیل متن به گفتار را به بیش از ۱۱۰۰ زبان ارائه دهد.
متا پروژهی MMS را مثل بسیاری از مدلهای هوش مصنوعی قبلی خود بهطور منبعباز ارائه میدهد تا به حفظ تنوع زبانی کمک و محققان را به استفاده از آن تشویق کند. این شرکت میگوید: «امروز ما مدلها و کدهای خود را بهطور عمومی به اشتراک میگذاریم تا دیگران در جامعهی تحقیقاتی بتوانند از آنها براساس نیازشان استفاده کنند. امیدواریم با این اقدام، به حفظ تنوع زبانی باورنکردنی جهان کمک کوچکی کرده باشیم.»
مدلهای تبدیل متن به گفتار، معمولاً به آموزش با هزاران ساعت صدا بههمراه برچسبهای رونویسی نیاز دارند. برچسبها برای یادگیری ماشینی بسیار اهمیت دارند و به الگوریتمها اجازه میدهند دادهها را بهدرستی دستهبندی و درک کنند. البته چنین دادههایی برای زبانهایی که بهطور گسترده در کشورهای صنعتی مورداستفاده قرار نمیگیرند، بهسادگی دردسترس نیست.
متا از رویکردی غیرمتعارف برای جمعآوری دادههای صوتی استفاده کرد؛ بهرهگرفتن از صداهای ضبطشده از متون مذهبی. این شرکت گفت: «ما از تنوع متون مذهبی که به زبانهای مختلف ترجمه شدهاند، بهطور گسترده برای ارائهی ترجمهی آن زبانها، بهره گرفتهایم. این ترجمهها نسخههای صوتی هم دارند و افراد آنها را به زبانهای مختلف مطالعه میکنند.» محققان متا با استفاده از صداهای ضبطشده از متون مذهبی، تعداد زبانهای مدل هوش مصنوعی خود را به بیش از چهار هزار عدد افزایش دادند.
شاید فکر کنید استفاده از متنهای مذهبی باعث جهتگیری مدل هوش مصنوعی گفتاری متا شود اما براساس اعلام این شرکت، چنین اتفاقی رخ نخواهد داد. غول رسانههای اجتماعی جهان میگوید: «درحالیکه محتوای صداهای ضبطشده براساس متنهای مذهبی هستند، این مدل برای تولید زبان، تعصبی روی متنها ندارد زیرا ما از روش طبقهبندی زمانی پیوندگرا (CTC) استفاده میکنیم.»
اگرچه بیشتر متنهای مذهبی که متا از آنها در مدل هوش مصنوعی جدیدش بهره گرفته، با صدای مردان ضبط شدهاند، اما عملکرد این فناوری با صدای زنان دقیقاً شبیه نمونهی صدای مردان است و از این نظر تفاوتی ندارد.
به نوشتهی انگجت، متا پس از آموزش مدل هوش مصنوعی گفتاری خود برای استفاده از دادههای بیشتر، از wav2vec 2.0 بهره گرفت؛ مدل یادگیری گفتاری خودنظارتی این شرکت که میتواند روی دادههای بدون برچسب، آموزش ببیند. ترکیب منابع دادههای نامتعارف و مدل گفتاری خودنظارتی، نتایج چشمگیری به دنبال داشت. مدلهای گفتاری چندزبانه در مقایسه با مدلهای موجود، عملکرد بسیار خوبی دارند و تا ۱۰ برابر زبانهای بیشتری را پوشش میدهند. بهطور خاص، متا MMS را با Whisper شرکت OpenAI مقایسه کرد و عملکرد فناوری متا، فراتر از انتظار بود.
البته متا میگوید مدلهای هوش مصنوعی جدیدش کاملاً بینقص نیستند. این شرکت توضیح داد: «برای مثال این خطر وجود دارد که مدل گفتار به نوشتار ما، کلمات یا عبارتهای انتخابی را بهاشتباه تعبیر کند. با توجه به نوع خروجی، این مشکل میتواند به توهین یا ارائهی متن نادرست منجر شود. ما اعتقاد داریم همکاری سرتاسری در جامعهی هوش مصنوعی برای توسعهی مسئولانهی این فناوریها حیاتی است.»
متا امیدوار است با متنباز کردن MMS به گسترش و بهبود این فناوری کمک کند و روزی را میبیند که افراد بتوانند در سرتاسر جهان هرچیز را به زبان مادری خود یاد بگیرند و با هر فرد دیگری با زبان خود صحبت کنند.
متا زبانهای نانوشته را نیز تفسیر می کند
درحالحاضر حدود ۷۰۰۰ زبان در جهان شناخته شده است که برخی از آنها مؤلفههای نوشتاری ندارند. این نوع زبانها که از آنها بهعنوان «زبانهای نانوشته» یاد میشود، مشکل منحصربهفردی برای سیستمهای ترجمهی یادگیری ماشینی مدرن ایجاد میکنند؛ زیرا چنین سیستمهایی برای تبدیل یک متن از زبانی به زبان دیگر، به گفتاری نیاز دارند که بتوان آن را به نوشتار تبدیل کرد. بههرحال گزارش شده است که متا درحالحاضر سعی دارد با هوش مصنوعی، این مشکل را رفع کند.
متا اکنون مشغول توسعهی سیستم ترجمهی گفتار به گفتار لحظهای است تا ساکنان متاورس بتوانند راحتتر با یکدیگر تعامل داشته باشند. محققان این شرکت اکنون بهعنوان بخشی از این پروژه که مترجم متن گفتاری جهانی متا (UST) نام دارد، سعی دارند سیستمی برای ترجمهی زبان Hokkien به انگلیسی ایجاد کنند. این زبان نانوشته در سرتاسر دیاسپورای آسیا مورداستفاده قرار میگیرد و یکی از زبانهای رسمی تایوان است. دیاسپورا به افراد مهاجری اطلاق میشود که خارج از کشور محل تولد یا اصل و نسب خود، بهصورت موقت یا دائم ساکن هستند، اما روابط عاطفی و مادی خود را با کشورهای مبدأ همچنان حفظ میکنند.
به گزارش انگجت، آموزش اولیهی سیستمهای ترجمهی مبتنیبر یادگیری ماشینی، معمولاً به نمونههای قابل برچسبگذاری گسترده از زبان بهصورت نوشتاری یا گفتاری نیاز دارد و این دقیقاً مؤلفهای است که زبانهای نانوشته مانند Hokkein از آن بیبهره هستند. مارک زاکربرگ، مدیرعامل متا در پستی وبلاگی توضیح داد:
ما برای رفع مشکل زبانهای نانوشته، از ترجمهی گفتار به واحد (S2UT) برای تبدیل گفتار به دنبالهای از واحدهای صوتی که متا قبلاً در آن پیشگام بوده است، استفاده کردیم. سپس شکل موجها را براساس واحدها ایجاد کردیم. علاوهبراین از UnitY بهعنوان مکانیزم رمزگشایی استفاده شد که اولین گذر متنی را به یک زبان مرتبط (مثل ماندارین) ایجاد میکند و رمزگشای گذر دوم نیز وظیفهی ساخت واحدها را برعهده دارد.
بیشتر بخوانید:
زاکربرگ در تکمیل توضیحات خود گفت:
ما از ماندارین بهعنوان یک زبان میانی برای ساختن برچسبهای کاذب استفاده کردیم، جاییکه ابتدا گفتار انگلیسی (یا Hokkien) را به متن ماندارین و سپس به Hokkien (یا انگلیسی) ترجمه کردیم و دادههای آموزشی نیز دراین مرحله به آن اضافه شد.
درحالحاضر سیستم مترجم متن هوش مصنوعی متا به افرادی که با زبان Hokkien صحبت میکند اجازه میدهد تا با کسی که انگلیسی حرف میزنند صحبت کنند. این مدل میتواند بهطور لحظهای فقط یک جملهی کامل را درک و آن را ترجمه کند، اما زاکربرگ اطمینان دارد که تکنیک متا درنهایت میتواند برای ترجمهی زبانهای دیگر نیز مورد استفاده قرار گیرد و ترجمهی بلادرنگ آن نیز بهبود یابد.
متا علاوهبر ارائهی مدلها و دادههای آموزشی بهعنوان پروژههای منبعباز، اولین سیستم محکگذاری ترجمهی گفتار به گفتار را براساس مجموعه گفتار Hokkien در سرتاسر تایوان منتشر میکند. زاکربرگ اعلام کرده است که ماتریس گفتار، مجموعهی بزرگی از ترجمههای گفتار به گفتار است که با تکنیک دادهکاوی مبتکرانهی متا موسوم به لیزر استخراج شده است و به محققان اجازه میدهد تا با استفاده از آن، سیستمهای ترجمهی گفتار به گفتار (S2ST) خود را ایجاد کنند.
هوش مصنوعی متا توضیحات متنی را به کد تبدیل میکند
متا ابزار هوش مصنوعی جدیدی بهنام Code Llama منتشر کرده که برپایهی مدل زبان بزرگ Llama 2 ساخته شده و هدف آن، کمک به برنامهنویسان برای تولید کد است.
Code Llama از مجوز مشابه Llama 2 بهره میبرد و بهبیان دیگر استفاده از آن برای تحقیقات و همچنین پروژههای تجاری، کاملاً رایگان است.
متا میگوید Code Llama رشته کدهای موردنظر شما را براساس دستورات ورودی متنی تولید میکند. این ابزار همچنین میتواند رشته کد خاصی را تکمیل و مشکلات آن را رفع کند. متا در کنار این ابزار، نسخهی تخصصی پایتون این مدل موسومبه Code Llama-Python و نسخهی دیگری بهنام Code Llama-Instrct را نیز منتشر کرده که توانایی درک دستورالعملهای دریافتی به زبان طبیعی را دارد.
براساس اعلام متا، امکان استفاده از کدهای تولید شده در نسخهی خاصی از Code Llama در سایر نسخههای این ابزار وجود ندارد. این شرکت همچنین Code Llama پایه یا Code Llama-Python را برای دریافت دستورالعملهای به زبان طبیعی توصیه نمیکند.
متا ادعا میکند Code Llama براساس آزمایشهای معیار HumanEval، بهتر از نمونههای عمومی دیگر عمل میکند اما بهطور مشخص نامی از مدلهای رقیب نبرده است. این شرکت میگوید Code Llama در معیار کد HumanEval امتیاز ۵۳٫۷ درصد را کسب کرده و میتواند توضیحات متنی را بهطور دقیق به کد تبدیل کند.
Code Llama در سه سایز منتشر خواهد شد که براساس اعلام متا، کوچکترین آنها روی یک کارت گرافیک قابل اجرا است و برای انجام پروژههای سبک توصیه میشود.
از مدتی قبل شاهد انتشار ابزارهای هوش مصنوعی تولید کد هستیم که توسعهدهندگان برای افزایش سرعت و دقت انجام پروژههای خود از آنها بهره میبرند. ماه مارس گیتهاب Copilot منتشر شد تا سرعت کدنویسی و اشکالزدایی کدها را افزایش دهد. این ابزار همچنین میتواند کدهای قدیمی را بهروزرسانی کند.
آمازون AWS نیز از ابزار CodeWhisperer بهره میبرد که کدهای برنامهنویسی را بررسی و آنها را بهروز میکند. گوگل نیز ابزار کدنویسی هوش مصنوعی خود موسومبه AlphaCode را دارد که هنوز دردسترس عموم قرار نگرفته است.
شرکت مادر گیتهاب یعنی مایکروسافت و OpenAI به اتهام نقض قانون کپیرایت در Copilot با شکایت مواجه شدهاند؛ زیرا این ابزار میتواند کدهای تجاری دیگران را بازتولید کند.




















































