اگر اخبار حوزه AI را دنبال کنید، احتمالاً متوجه شدهاید که تقریباً هر روز با چند اصطلاح جدید روبهرو میشویم. بعضی از این واژهها سالهاست در فضای تحقیقاتی استفاده میشوند و بعضی دیگر تازه با ظهور مدلهای جدید و روشهای متفاوت reasoning وارد بحثهای عمومی شدهاند.
یکی از اصطلاحاتی که اخیراً بیشتر مورد توجه قرار گرفته opaque recurrence است. ایده کلی این مفهوم به استفاده تکراری از محاسبات داخلی یک مدل برای حل مسئله مربوط میشود؛ یعنی مدل میتواند برای رسیدن به پاسخ، محاسبات بیشتری را در فضای داخلی خود انجام دهد، بدون اینکه تمام این فرایند الزاماً به شکل یک متن قابل مشاهده برای کاربر نمایش داده شود.
دلیل اهمیت این موضوع فقط افزایش توانایی مدل نیست. هرچه بخش بیشتری از reasoning در محاسبات داخلی مدل انجام شود، بررسی اینکه مدل دقیقاً چگونه به نتیجه رسیده دشوارتر میشود. این مسئله برای پژوهشگران AI safety اهمیت زیادی دارد، چون در سیستمهای قدرتمند فقط گرفتن یک پاسخ خوب کافی نیست و باید بتوان رفتار مدل را تا حد ممکن بررسی و ارزیابی کرد.
در همین بحث ممکن است با اصطلاح chain of thought هم مواجه شوید. Chain of thought به فرایند مرحلهای reasoning اشاره دارد که در آن مدل برای حل یک مسئله پیچیده به چند مرحله میاندیشد. البته چیزی که مدل در قالب متن تولید میکند لزوماً نمایش کاملی از محاسبات واقعی داخل شبکه عصبی نیست، اما از نظر مفهومی تفاوت مهمی با reasoning کاملاً داخلی دارد.
اصطلاح دیگری که در این زمینه مطرح میشود recurrent depth است. در معماریهای recurrent، یک بخش از شبکه میتواند چندین بار برای انجام محاسبات بیشتر مورد استفاده قرار بگیرد. هدف این روش میتواند افزایش ظرفیت reasoning بدون افزایش مستقیم اندازه مدل باشد.
در طرف دیگر، واژه neuralese بیشتر برای توصیف یک ایده و سناریوی احتمالی در آینده AI استفاده میشود. منظور این است که یک مدل ممکن است برای انجام بخشهایی از reasoning از representationهای داخلی استفاده کند که برای انسان قابل خواندن نیستند. در چنین شرایطی، حتی اگر مدل عملکرد بسیار خوبی داشته باشد، فهمیدن فرایند داخلی آن برای انسان سختتر خواهد شد.
اما اینها تنها اصطلاحات مهم دنیای AI نیستند. یکی از شناختهشدهترین واژهها LLM یا Large Language Model است. LLMها مدلهایی هستند که با حجم بسیار زیادی از داده آموزش میبینند و میتوانند کارهایی مثل تولید متن، ترجمه، خلاصهسازی، پاسخ به سؤال و کدنویسی را انجام دهند.
RAG یا Retrieval-Augmented Generation هم در سالهای اخیر به یکی از مهمترین روشها برای ساخت محصولات واقعی AI تبدیل شده است. در یک سیستم RAG، مدل قبل از پاسخ دادن میتواند اطلاعات مرتبط را از منابع خارجی مانند اسناد، database یا vector database بازیابی کند. به همین دلیل RAG برای chatbotهای سازمانی و سیستمهایی که باید بر اساس اطلاعات اختصاصی یک مجموعه پاسخ بدهند، بسیار کاربردی است.
AI agent با یک chatbot معمولی تفاوت دارد. یک agent میتواند برای رسیدن به یک هدف، چند مرحله را پشت سر هم انجام دهد، از tool استفاده کند، اطلاعات جمع کند و بر اساس نتیجه هر مرحله تصمیم بگیرد که چه کاری را بعداً انجام دهد. به همین دلیل agentها یکی از بخشهای مهم نسل جدید نرمافزارهای AI هستند.
احتمالاً اصطلاح hallucination را هم زیاد شنیدهاید. وقتی یک مدل AI اطلاعاتی را تولید میکند که واقعیت ندارد یا از اطلاعات موجود پشتیبانی نمیشود، معمولاً از hallucination صحبت میکنیم. مشکل اصلی این است که مدل ممکن است چنین پاسخ اشتباهی را کاملاً مطمئن و طبیعی بیان کند. برای همین در کاربردهای حساس، پاسخ AI باید تا حد امکان با منبع معتبر بررسی شود.
Inference اصطلاح دیگری است که در بحث مدلهای AI زیاد استفاده میشود. Inference همان مرحلهای است که مدل آموزشدیده برای دریافت ورودی و تولید خروجی اجرا میشود. در یک سیستم واقعی، سرعت inference اهمیت زیادی دارد و عواملی مثل GPU، RAM، VRAM، تعداد پارامترهای مدل، quantization و اندازه context میتوانند روی عملکرد آن تأثیر بگذارند.
Token هم واحدی است که مدلهای زبانی برای پردازش متن از آن استفاده میکنند. متن ورودی و خروجی به token تقسیم میشود و به همین دلیل هنگام صحبت درباره هزینه یا سرعت مدل معمولاً اصطلاحاتی مانند token usage و token throughput را میبینیم.
یکی دیگر از اصطلاحات مهم Mixture of Experts یا MoE است. در این معماری، مدل از چند بخش تخصصی یا expert تشکیل میشود و برای هر ورودی لزوماً تمام پارامترهای مدل فعال نمیشوند. این روش میتواند به ساخت مدلهای بسیار بزرگ کمک کند، در حالی که هزینه محاسباتی هر درخواست کنترل شود.
RLHF یا Reinforcement Learning from Human Feedback نیز روشی است که در توسعه و تنظیم برخی مدلهای زبانی استفاده شده است. در این روش، بازخورد انسان برای هدایت رفتار مدل مورد استفاده قرار میگیرد تا خروجیها بیشتر با ترجیحات و انتظارات انسان هماهنگ شوند.
در کنار این اصطلاحات، واژههایی مثل deep learning، reinforcement learning، transformer، diffusion model، fine-tuning، embedding و vector database هم بخش مهمی از vocabulary امروزی AI را تشکیل میدهند.
نکته مهم این است که هر اصطلاح جدیدی که در اخبار AI میبینیم الزاماً به یک فناوری کاملاً جدید یا یک استاندارد صنعتی تبدیل نمیشود. بعضی اصطلاحات برای توضیح یک روش تحقیقاتی خاص ساخته میشوند و ممکن است بعدها کمتر استفاده شوند. بنابراین بهتر است به جای حفظ کردن تعداد زیادی buzzword، بدانیم هر اصطلاح دقیقاً چه مشکلی را توضیح میدهد و در چه شرایطی استفاده میشود.
سرعت پیشرفت AI باعث شده فاصله بین research و محصول واقعی هم کمتر شود. تکنیکی که امروز در یک مقاله تحقیقاتی مطرح میشود ممکن است مدت کوتاهی بعد در یک مدل تجاری یا ابزار عمومی دیده شود. به همین دلیل آشنایی با vocabulary این حوزه برای توسعهدهندگان، مدیران فناوری و حتی کاربران حرفهای AI روزبهروز اهمیت بیشتری پیدا میکند.
منبع و مطلب اصلی: TechCrunch