کلود بهزودی روی متنهای تولیدشده با هوش مصنوعی واترمارک میگذارد؛ آیا کیفیت نوشتهها کاهش مییابد؟
شرکت آنتروپیک قصد دارد در پی اجرای مقررات اتحادیه اروپا، سازوکاری برای واترمارکگذاری متنهای تولیدشده توسط مدل هوش مصنوعی «کلود» ایجاد کند؛ اقدامی که به گفته این شرکت برای خواننده عادی قابل تشخیص نخواهد بود، اما برخی کارشناسان درباره تأثیر احتمالی آن بر کیفیت و دقت نوشتههای تولیدشده با هوش مصنوعی هشدار دادهاند.
به گزارش اینتیتر، جهان حالا با نشانههای آشنای متنهای تولیدشده توسط هوش مصنوعی بیگانه نیست؛ استفاده بیش از حد از واژههایی مانند «کاوش کردن» (delve)، بهکارگیری مکرر خط تیره بلند و ساختارهای تکراری مانند «موضوع X نیست، بلکه Y است». حالا این پرسش مطرح شده که آیا قرار است نوشتههای تولیدشده با هوش مصنوعی حتی بدتر از این هم بشوند؟
به گزارش گاردین، شرکت آنتروپیک در آخر هفته اعلام کرد تغییراتی در نحوه تولید متن توسط مدل هوش مصنوعی «کلود» ایجاد خواهد کرد. این تغییرات در راستای اجرای مقررات اتحادیه اروپا انجام میشود؛ مقرراتی که شرکتهای فعال در حوزه هوش مصنوعی را ملزم میکند از ماه دسامبر، محتوای تولیدشده توسط هوش مصنوعی را واترمارکگذاری کنند.
آنتروپیک اعلام کرده این تغییرات در سطحی بسیار جزئی و تصادفی، همزمان با فرآیند تولید متن توسط مدل اعمال میشوند و برای یک خواننده معمولی قابل تشخیص نخواهند بود.
با این حال، دستکم یک تحلیلگر با این رویکرد موافق نیست. «جان گروبر»، وبلاگنویس باسابقه حوزه فناوری، این اقدام را «دستکاری نادرست در ماهیت نوشتن» توصیف کرده است. او معتقد است واترمارکگذاری میتواند آزادی عمل کلود را محدود کند و باعث شود این مدل در مجموع واژههای ضعیفتر و کمدقتتری را انتخاب کند.
گروبر استدلال میکند که ممکن است این محدودیتها الزاماً دقت محتوای تولیدشده را کاهش ندهند، اما میتوانند کیفیت کلی نثر را پایین بیاورند.
مدلهای زبانی بزرگ در انتخاب واژههای مختلف، میزانی از تصادفیبودن را در اختیار دارند. برای مثال، یک مدل ممکن است برای توصیف یک روز از واژه «خاکستری» استفاده کند یا «ابری» را ترجیح دهد؛ یا برای اشاره به جریان آب، «جویبار» را انتخاب کند یا «نهر».
واترمارک جدید آنتروپیک قرار است همین انتخابهای تصادفی را تا حدی تغییر دهد. طبق توضیحات این شرکت، این تغییرات الگویی ایجاد میکنند که برای خود آنتروپیک و افرادی که کلید رمزگشایی آن را در اختیار دارند، قابل شناسایی خواهد بود.
«استیون مرداک»، استاد علوم رایانه در دانشگاه کالج لندن، معتقد است این تغییر احتمالاً تأثیر محسوسی بر کیفیت متن نخواهد داشت.
به گفته او، انتقاد گروبر بیشتر از این موضوع ناشی میشود که واترمارکگذاری آزادی مدل زبانی بزرگ را در انتخاب واژه بعدی محدود میکند و ممکن است در نتیجه، مدل همیشه بهترین گزینه را انتخاب نکند.
با این حال، مدلهای زبانی بزرگ حتی در شرایط عادی نیز لزوماً بهترین انتخاب ممکن را انجام نمیدهند.
مرداک میگوید: «در حال حاضر هم در تمام این مدلهای زبانی بزرگ نوعی تصادفیبودن وجود دارد و این ویژگی برای نحوه عملکرد آنها کاملاً ضروری است. اگر این تصادفیبودن وجود نداشت، مدلها ممکن بود وارد حلقههای تکراری شوند و دائماً یک عبارت را تکرار کنند.»
به بیان سادهتر، وقتی یک چتبات برای توصیف آب جاری واژه «جویبار» را به جای «نهر» انتخاب میکند، لزوماً به این دلیل نیست که درباره تفاوت ظریف معنایی یا سبک ادبی این دو واژه فکر کرده است. مدل در واقع چنین انتخابی را به شکل تصادفی و بر اساس احتمالات موجود در فرآیند تولید متن انجام میدهد.
نمونههایی از این مشکل پیشتر نیز دیده شده است. اخیراً مقالهای در یکی از مجلات معتبر شیمی پس از آن پس گرفته شد، زیرا به نظر میرسید نویسندگان بخشی از متن مقاله را با کمک یک ابزار هوش مصنوعی نوشتهاند. این ابزار در بخشی از متن که ظاهراً درباره یک «نانوجِل» حاوی روی بود، عبارت نامرتبط و عجیب «کشتار جمعی یک گروه قومی» را به عنوان جایگزینی برای عبارت «راهحل نهایی» پیشنهاد کرده بود.
مرداک درباره بهروزرسانی جدید کلود گفت که کاربران احتمالاً تفاوت قابلتوجهی در متنهای تولیدشده مشاهده نخواهند کرد. به گفته او، همان مولدهای اعداد تصادفی سابق همچنان مورد استفاده قرار میگیرند؛ تفاوت این است که این انتخابها دیگر کاملاً تصادفی نیستند و از نظر آماری قابلیت شناسایی پیدا میکنند.
مقررات اتحادیه اروپا که شرکتهای هوش مصنوعی را هدف قرار داده، قرار است طی ماههای آینده اجرایی شود و شرکتها را ملزم به استفاده از چنین سازوکارهایی کند. اجرای این طرح میتواند شناسایی محتوای تولیدشده توسط چتباتها را آسانتر کند و در نتیجه، استفاده از متنهای تولیدشده با هوش مصنوعی به نام خود افراد را برای دانشجویان، وکلا و استادان دانشگاه دشوارتر سازد.
با این حال، واترمارکگذاری تنها برای شناسایی تقلب یا مقابله با انتشار اطلاعات نادرست مطرح نشده است.
مرداک معتقد است حجم محتوای تولیدشده توسط هوش مصنوعی در اینترنت به اندازهای افزایش یافته که میتواند برای خود مدلهای هوش مصنوعی نیز مشکلساز شود. آموزش مدلهای جدید با استفاده گسترده از محتوای تولیدشده توسط مدلهای قبلی میتواند پدیدهای موسوم به «فروپاشی مدل» (Model Collapse) ایجاد کند؛ وضعیتی که در آن مدلها بهتدریج در تشخیص و تفکیک مفاهیم دچار مشکل میشوند.
به این ترتیب، واترمارکگذاری محتوای تولیدشده با هوش مصنوعی ممکن است فقط ابزاری برای مقابله با تقلب و اطلاعات نادرست نباشد؛ بلکه راهکاری برای جلوگیری از انباشتهشدن محتوای تولیدشده توسط هوش مصنوعی و تأثیر مخرب آن بر نسلهای بعدی مدلهای زبانی نیز محسوب میشود.