>> دیپمایند گوگل سیستم SAFE را برای شناسایی توهم در هوش مصنوعی مولد عرضه کرد >> هوش مصنوعی مولد با وجود پیشرفتهای چشمگیر در سالهای اخیر، همچنان با چالشهای اساسی روبروست. یکی از نگرانیهای اصلی کاربران و محققان، پدیدهای به نام توهم است که در آن مدلهای زبانی پاسخهایی با ظاهری معقول و مطمئن ارائه میدهند، اما محتوای آنها از نظر حقیقتی نادرست یا بیاساس میباشد.
شرکت دیپمایند، زیرمجموعه گوگل، اخیراً راهکاری نوین برای کاهش این خطا و افزایش اعتبار خروجیهای مدلها معرفی کرده است. معرفی سیستم SAFE ارزیاب واقعیتسنجی تقویتشده با جستجو محققان دیپمایند در همکاری با دانشگاه استنفورد، یک پیشنویس مقاله علمی را در آرکایو منتشر کردهاند که در آن سیستمی با نام (SAFE) پیشنهاد شده است.
این سیستم به طور خودکار پاسخهای طولانی تولیدشده توسط چتباتها را تجزیه و تحلیل کرده و صحت اطلاعات موجود در آنها را مورد ارزیابی قرار میدهد. برخلاف روشهای سنتی که تنها بر روی دانش درونی مدل متکی هستند، SAFE از موتور جستجوی گوگل به عنوان منبع معتبر خارجی برای تأیید حقایق استفاده میکند.
یات مجزا و ی شکسته میشود تا امکان بررسی جداگانه هر کدام فراهم گردد.
بازبینی و استدلال سیستم هر گزاره را مورد بازبینی قرار داده و پیوند منطقی آن با پرسش اصلی کاربر را بررسی میکند. مقایسه با نتایج جستجو هر گزاره با نتایج بهدستآمده از جستجوی گوگل مقایسه شده و اعتبار آن از طریق وبسایتهای معتبر تایید یا رد میشود. ارزیابی زگی در نهایت، سیستم تعیین میکند که آیا هر گزاره تاییدشده، مستقیماً مرتبط با سوال پرسیده شده بوده یا خیر.
ارزیابی عملکرد با مجموعه داده جهت سنجش کارایی این سیستم، تیم تحقیق یک مجموعه داده (بنیادینه) به نام را تدوین کردند که شامل حدود ۱۶ هزار گزاره متنوع است. برای آزمایش جامع، از ۱۳ مدل زبانی بزرگ (LLM) متعلق به چهار خانواده متمایز شامل GPT، جیمینای، کلود و استفاده شد.
نتایج حاصل از این آزمایشها نشاندهنده عملکرد بسیار ِভای سیستم SAFE است در **۷۲ درصد** موارد، تصمیمگیریهای سیستم SAFE با نظرات حاشیهنویسان و مصححهای انسانی همجهت بود. در مواردی که بین سیستم و ارزیابان انسانی اختلاف نظر وجود داشت، SAFE در **۷۶ درصد** موارد به درستی عمل کرد و قضاوت دقیقتری داشت.
ی مهم در جهت حل چالش توهم و افزایش قابلیت اعتماد مدلهای زبانی بزرگ محسوب میشود.
با فراهم آوردن روشی خودکار، مقیاسپذیر و کمهزینه برای واقعیتسنجی، این فناوری میتواند در خط لوله توسعه و استقرار مدلهای هوش مصنوعی در تولیدات تجاری و علمی به کار رود. این پیشرفت امکان بررسی خودکار کیفیت خروجیهای مدلها را بدون نیاز به نظارت انسانی پرهزینه و کند فراهم میآورد و مسیر را برای کاربردهای حساستر از نظر دقت در پزشکی، حقوق و مهندسی هموار میکند. >>