تخصص و قضاوت انسانی؛ مزیت رقابتی جدید
در این مطالعه، شش وظیفه مربوط به غربالگری اطلاعات مورد آزمایش قرار گرفت، از جمله تشخیص اینکه آیا یک مقاله مرتبط و کاربردی است یا خیر. بریجواتر در ابتدا از نمونههایی استفاده کرد که افراد غیرمتخصص برچسبگذاری کرده بودند تا نشان دهند چه چیزی مرتبط یا مفید محسوب میشود، اما مشخص شد بسیاری از آن قضاوتها اشتباه بودهاند. مقالهها و اطلاعاتی که درباره کاربردی بودن یا نبودنشان اختلافنظر وجود داشت، برای بررسی به سرمایهگذاران خود بریجواتر ارجاع داده شد و از بازخورد آنها برای تنظیم دقیق یک مدل اختصاصی استفاده شد.
مدل به دست آمده توانست از سایر مدلهای تستشده توسط بریجواتر بهتر عمل کند، درحالیکه هزینه اجرای آن به مراتب کمتر بود.
این آزمایش محدود بود، اما درس آن ساده است: دادههای مالی به وفور در دسترس بود تا در اختیار هوش مصنوعی قرار بگیرد، اما دسترسی به «قضاوت قابل اعتماد» درباره اینکه کدام اطلاعات واقعا اهمیت دارند، بسیار دشوارتر بود.
دادهای کمیاب در عصر هوش مصنوعی
مدلهای زبانی بزرگ (LLM) نوعی از مدلهای پایه هستند. آنها سیستمهای هوش مصنوعی عمومی هستند که میتوانند با وظایف مختلف تطبیق داده شوند.
مدلهای زبانی بزرگ میتوانند گزارشهای مالی، اسناد حقوقی و مقالات علمی را در مقیاس غولآسا پردازش کنند. اما دسترسی به این حجم از اطلاعات، هرگز جای قضاوت کسی را نمیگیرد که سالها در آن حوزه کار کرده است.
متخصصان یاد میگیرند که کدام جزئیات، شایان توجه است، کدام اشتباهات اهمیت دارند و چه زمانی ممکن است پروسه همیشگی به شکست بینجامد. برخی از این درسها و قضاوتها را میتوان ثبت کرد، اما برخی دیگر تنها طی تصمیماتی که افراد میگیرند نمایان میشوند. به عنوان مثال، یک تحلیل سرمایهگذاری میتواند حاوی اطلاعات درستی باشد اما روی سیگنالهای اشتباهی تمرکز کند. تولید نمونههای بیشتر، بدون داشتن یک روش قابل اعتماد برای سنجش کیفیت آنها، فقط تا یک جایی جواب میدهد.
بهعلاوه، قضاوت کارشناسانه یک حقیقت مطلق نیست. متخصصان میتوانند با هم اختلافنظر داشته باشند، چون اهداف، میزان ریسکپذیری و اولویتهای سازمانی متفاوتی دارند. مدلی که بر اساس تصمیمات بریجواتر آموزش دیده، یاد میگیرد که چه اطلاعاتی از نظر بریجواتر مرتبط و مفید است، پس شاید نتواند یک مرجع جهانی برای قضاوت سرمایهگذاری باشد.
همین «قضاوت مختص به یک سازمان» است که کار را برای توسعهدهندهها سخت کرده؛ موضوعی که این نوع داده را به مزیتی رقابتی برای سازمانها در عصر هوش مصنوعی تبدیل کرده است.
عضو جدید زنجیره تامین دادههای هوش مصنوعی
این روزها تقاضا برای «قضاوت انسانی و تخصصی» بسیار زیاد و بازار آن، داغ است. پلتفرمهایی مثل Mercor و Micro۱ که توسعهدهندگان هوش مصنوعی را به پزشکان، وکلا و دانشمندان وصل میکنند، درآمدهای میلیارد دلاری دارند.
کار این شرکتها فراتر از برچسبگذاری ساده دادههاست. آنها صورت مسالههای واقعی مینویسند، خروجی مدلها را نقد میکنند و خطاهای تخصصی را شناسایی میکنند. به عبارت دیگر، میتوانند «دانش عمومی تخصصی» (مثل دانش استاندارد پزشکی یا فرمولهای مالی) را از متخصصان بخرند و به هوش مصنوعی تزریق کنند. این کار، مدلهای عمومی را بسیار هوشمندتر میکند. این بازار شاید خرید دانش عمومی تخصصی را آسان کند، اما «دانش خاص یک سازمان» (مثل دادههای مشتریان، تصمیمات قبلی و فرآیندهای داخلی) چیزی نیست که بتوانید از بازار بخرید.
گنجینهای که دست اینترنت به آن نرسیده
بخش زیادی از اطلاعاتی که پشت تصمیمهای درست یک شرکت وجود دارد، هرگز در اینترنت منتشر نمیشود، مثل پروندههای غیرمعمول مشتریان، شکستهای عملیاتی و موارد خاصی که کارکنان با سابقه فوت و فن رسیدگی به آنها را بلدند. به همین دلیل است که موسسه حقوقی «کرکلنداند الیس» نیممیلیارد دلار روی ساخت سیستم هوش مصنوعی اختصاصی خود سرمایهگذاری کرده تا این دانش درونی را چارچوببندی کند.
همزمان با فراگیر شدن مدلهای پایه، مزیت شرکتها دیگر دسترسی به هوش مصنوعی نیست، بلکه «کیفیت بازیابی اطلاعات، مثالهای غنیتر، ارزیابیهای قویتر و ثبت نتایج تصمیمهای قبلی» است.
هر بار که کارکنان خروجی هوش مصنوعی را اصلاح، رد یا نهایی میکنند، در واقع دارند «معیار عملکرد خوب» را به هوش مصنوعی آموزش میدهند. ثبت همین اصلاحات روزمره و کوچک کارکنان است که خوراک اصلی را برای ارتقای هوش مصنوعی میسازد؛ دانشی که رقیبان هرگز نمیتوانند آن را کپی کنند.
دادههای مصنوعی همچنان نیازمند اعتبارسنجی
دادههای مصنوعی (دادههایی که به جای جمعآوری از دنیای واقعی، توسط سیستمها تولید میشوند) میتوانند نیاز به نمونههای انسانی را کم کنند. این روش در حوزههایی مثل ریاضی، برنامهنویسی و استدلال منطقی که خطکش و معیار سنجش مشخصی دارند، به خوبی جواب میدهد.
ارزیابی این دادهها همیشه نیاز به نیروی انسانی ندارد و برنامههای نرمافزاری یا شبیهسازها هم میتوانند کیفیت را بسنجند. اما در حوزههای پیچیدهتر مثل پزشکی، ماجرا فرق میکند. در این حوزهها بررسی خروجی هوش مصنوعی یا «ارائه بازخورد به سیستم»، هم زمانبر است و هم گران. سوال اصلی و اقتصادی این است: «به دست آوردن بازخورد قابلاعتماد برای سیستم، چقدر هزینه برمیدارد؟» هر جا ارزیابی کیفیت به تخصص نایاب یا زمان طولانی نیاز داشته باشد، بازخورد گرفتن همچنان گران و سخت خواهد بود.
از سوی دیگر، ضبط و استفاده از قضاوتهای انسانی، چالشهای حقوقی و نظارتی نیز دارد، چرا که اصلاحات کارکنان و تعاملات مشتریان، حاوی اطلاعات محرمانه است و سازمانها باید مجوزهای قانونی و کنترلهای دسترسی لازم را برای استفاده مجدد از این دادهها دریافت کنند.
جمعآوری دادههای عملکرد شرکتی معتبر
همزمان با فراگیر شدن مدلهای پیشرفته، مسابقه بعدی دادهها در هوش مصنوعی، جمعآوری حجم بیشتر اطلاعات نیست بلکه دستیابی به شواهد معتبر از عملکرد خوب در محیط واقعی همان سازمان است.
این یعنی علم به اینکه کدام پیشنهادها در عمل موفق شدند، کدامها شکست خوردند و کارشناسان چه پاسخی را رد کردند.
منبع: World Economic Forum