جری ساینفلد، کمدین آمریکایی، یه جمله بامزه درباره AI داره:
ما اونقدر باهوش بودیم که AI رو اختراع کنیم، اونقدر خنگ بودیم که بهش نیاز پیدا کنیم، و اونقدر احمقیم که نمیتونیم بفهمیم اصلاً کار درستی کردیم یا نه.
😂😂😂
چند روز پیش آنتروپیک یه مقاله منتشر کرد که به نظرم دقیقاً وسط همین وضعیت قرار میگیره. 😈
ما مدلهایی ساختیم که میتونن کد بنویسن، مسئله حل کنن، استدلال کنن، ابزار صدا بزنن و گاهی رفتاری نشون بدن که از بیرون شبیه فکر کردن به نظر میاد.
اما هنوز درست نمیدونیم داخلشون چه خبر است.
آنتروپیک توی این مقاله درباره چیزی به نام J-space صحبت میکنه، یک جور فضای داخلی در مدل Claude که بعضی مفاهیم، قبل از اینکه وارد خروجی مدل بشن، اونجا دیده میشن.
پیشنهاد این رو بخورنید:
https://www.anthropic.com/research/global-workspace
مثلاً مدل ممکنه در خروجی چیزی نگه، اما داخل این فضا نشانههایی از مفاهیمی مثل bug، fake، injection یا حتی مراحل میانی حل یک مسئله دیده بشه.
انگار مدل ممکنه توی خروجی، و حتی در مراحل thinking، اشارهای بهش نکنه؛ ولی داخل این فضا این مفهوم فعال شده باشه و روش محاسباتی انجام شده باشه.
نوشتم محاسبات، ننوشتم روش فکر شده، چون هنوز نمیتونم قبول کنم واقعاً فکر میکنه 😁😁😁
این بخش برای من خیلی جالبه، چون ما معمولا فقط چیزی رو میبینیم که مدل مینویسه.
اما بخش مهمی از رفتار مدل ممکنه قبل از خروجی نهایی شکل گرفته باشه؛ در جایی که نه prompt مستقیمه، نه response نهایی، نه chain of thought قابلمشاهده.
یک جور فکر خاموش.
الان بخش بزرگی از اینترنت دارن درباره این حرف میزنن که آنتروپیک «خودآگاهی» رو توی هوش مصنوعی پیدا کرده.
اما به نظرم نباید سریع بپریم سمت بحثهایی مثل خودآگاهی و این حرفها.
نکته مهمتر و عملیتر اینه که شاید کمکم داریم ابزارهایی پیدا میکنیم برای دیدن اینکه مدل قبل از جواب دادن، چه چیزهایی رو داخل خودش فعال کرده.
این برای safety، debugging و فهمیدن رفتار مدلها خیلی مهمه.
چون اگر فقط خروجی نهایی رو ببینیم، ممکنه مدل خیلی تمیز و مودب جواب بده، اما مسیر داخلیاش چیز دیگری رو نشان بده.
مثلاً ممکنه بفهمه در حال تست شدنه. ممکنه متوجه prompt injection بشه. ممکنه یک هدف پنهان یا رفتار مشکوک در مسیر تصمیمگیریاش ظاهر بشه. یا ممکنه قبل از جواب نهایی، یک فرض اشتباه رو محور reasoning خودش قرار داده باشه.
برای من جذابیت این مقاله در همینجاست:
ما از مرحله «مدل چه جوابی داد؟» داریم کمکم میرسیم به مرحله «مدل قبل از جواب دادن، چه چیزی رو درگیر کرده بود؟»
چون اگر قرار باشه این مدلها بدون نظارت مستقیم انسان وارد فرآیندهای تصمیمگیری، مسائل امنیتی، automation و کارهای حساس بشن، فقط بهتر شدن خروجی کافی نیست.
باید بفهمیم پشت خروجی چه اتفاقی افتاده.
یا حداقل، کمی بیشتر از قبل بفهمیم.
شاید قدم بعدی در AI فقط ساختن مدلهای قویتر نباشه، بلکه ساختن راههایی باشه برای اینکه بفهمیم این مدلهای قویتر، قبل از جواب دادن، واقعاً به چه چیزهایی فکر کرده.