تخصص و قضاوت انسانی؛ مزیت رقابتی جدید

در این مطالعه، شش وظیفه مربوط به غربالگری اطلاعات مورد آزمایش قرار گرفت، از جمله تشخیص اینکه آیا یک مقاله مرتبط و کاربردی است یا خیر. بریج‌واتر در ابتدا از نمونه‌هایی استفاده کرد که افراد غیرمتخصص برچسب‌گذاری کرده بودند تا نشان دهند چه چیزی مرتبط یا مفید محسوب می‌شود، اما مشخص شد بسیاری از آن قضاوت‌ها اشتباه بوده‌اند. مقاله‌ها و اطلاعاتی که درباره کاربردی بودن یا نبودنشان اختلاف‌نظر وجود داشت، برای بررسی به سرمایه‌گذاران خود بریج‌واتر ارجاع داده شد و از بازخورد آنها برای تنظیم دقیق یک مدل اختصاصی استفاده شد.

مدل به دست آمده توانست از سایر مدل‌های تست‌شده توسط بریج‌واتر بهتر عمل کند، درحالی‌که هزینه اجرای آن به مراتب کمتر بود.

این آزمایش محدود بود، اما درس آن ساده است: داده‌های مالی به وفور در دسترس بود تا در اختیار هوش مصنوعی قرار بگیرد، اما دسترسی به «قضاوت قابل اعتماد» درباره اینکه کدام اطلاعات واقعا اهمیت دارند، بسیار دشوارتر بود.

داده‌ای کمیاب در عصر هوش مصنوعی

مدل‌های زبانی بزرگ (LLM) نوعی از مدل‌های پایه هستند. آنها سیستم‌های هوش مصنوعی عمومی هستند که می‌توانند با وظایف مختلف تطبیق داده شوند.

مدل‌های زبانی بزرگ می‌توانند گزارش‌های مالی، اسناد حقوقی و مقالات علمی را در مقیاس غول‌آسا پردازش کنند. اما دسترسی به این حجم از اطلاعات، هرگز جای قضاوت کسی را نمی‌گیرد که سال‌ها در آن حوزه کار کرده است.

متخصصان یاد می‌گیرند که کدام جزئیات، شایان توجه است، کدام اشتباهات اهمیت دارند و چه زمانی ممکن است پروسه همیشگی به شکست بینجامد. برخی از این درس‌ها و قضاوت‌ها را می‌توان ثبت کرد، اما برخی دیگر تنها طی تصمیماتی که افراد می‌گیرند نمایان می‌شوند. به عنوان مثال، یک تحلیل سرمایه‌گذاری می‌تواند حاوی اطلاعات درستی باشد اما روی سیگنال‌های اشتباهی تمرکز کند. تولید نمونه‌های بیشتر، بدون داشتن یک روش قابل اعتماد برای سنجش کیفیت آنها، فقط تا یک جایی جواب می‌دهد.

به‌علاوه، قضاوت کارشناسانه یک حقیقت مطلق نیست. متخصصان می‌توانند با هم اختلاف‌نظر داشته باشند، چون اهداف، میزان ریسک‌پذیری و اولویت‌های سازمانی متفاوتی دارند. مدلی که بر اساس تصمیمات بریج‌واتر آموزش دیده، یاد می‌گیرد که چه اطلاعاتی از نظر بریج‌واتر مرتبط و مفید است، پس شاید نتواند یک مرجع جهانی برای قضاوت سرمایه‌گذاری باشد.

همین «قضاوت مختص به یک سازمان» است که کار را برای توسعه‌دهنده‌ها سخت کرده؛ موضوعی که این نوع داده را به مزیتی رقابتی برای سازمان‌ها در عصر هوش مصنوعی تبدیل کرده است.

عضو جدید زنجیره تامین داده‌های هوش مصنوعی

این روزها تقاضا برای «قضاوت انسانی و تخصصی» بسیار زیاد و بازار آن، داغ است. پلتفرم‌هایی مثل Mercor و Micro۱ که توسعه‌دهندگان هوش مصنوعی را به پزشکان، وکلا و دانشمندان وصل می‌کنند، درآمد‌های ‌میلیارد دلاری دارند.

کار این شرکت‌ها فراتر از برچسب‌گذاری ساده‌ داده‌هاست. آنها صورت مساله‌های واقعی می‌نویسند، خروجی مدل‌ها را نقد می‌کنند و خطاهای تخصصی را شناسایی می‌کنند. به عبارت دیگر، می‌توانند «دانش عمومی تخصصی» (مثل دانش استاندارد پزشکی یا فرمول‌های مالی) را از متخصصان بخرند و به هوش مصنوعی تزریق کنند. این کار، مدل‌های عمومی را بسیار هوشمندتر می‌کند. این بازار شاید خرید دانش عمومی تخصصی را آسان کند، اما «دانش خاص یک سازمان» (مثل داده‌های مشتریان، تصمیمات قبلی و فرآیندهای داخلی) چیزی نیست که بتوانید از بازار بخرید.

گنجینه‌ای که دست اینترنت به آن نرسیده

بخش زیادی از اطلاعاتی که پشت تصمیم‌های درست یک شرکت وجود دارد، هرگز در اینترنت منتشر نمی‌شود، مثل پرونده‌های غیرمعمول مشتریان، شکست‌های عملیاتی و موارد خاصی که کارکنان با سابقه فوت و فن رسیدگی به آنها را بلدند. به همین دلیل است که موسسه حقوقی «کرکلند‌اند الیس» نیم‌میلیارد دلار روی ساخت سیستم هوش مصنوعی اختصاصی خود سرمایه‌گذاری کرده تا این دانش درونی را چارچوب‌بندی کند.

همزمان با فراگیر شدن مدل‌های پایه، مزیت شرکت‌ها دیگر دسترسی به هوش مصنوعی نیست، بلکه «کیفیت بازیابی اطلاعات، مثال‌های غنی‌تر، ارزیابی‌های قوی‌تر و ثبت نتایج تصمیم‌های قبلی» است.

هر بار که کارکنان خروجی هوش مصنوعی را اصلاح، رد یا نهایی می‌کنند، در واقع دارند «معیار عملکرد خوب» را به هوش مصنوعی آموزش می‌دهند. ثبت همین اصلاحات روزمره و کوچک کارکنان است که خوراک اصلی را برای ارتقای هوش مصنوعی می‌سازد؛ دانشی که رقیبان هرگز نمی‌توانند آن را کپی کنند.

داده‌های مصنوعی همچنان نیازمند اعتبارسنجی

داده‌های مصنوعی (داده‌هایی که به جای جمع‌آوری از دنیای واقعی، توسط سیستم‌ها تولید می‌شوند) می‌توانند نیاز به نمونه‌های انسانی را کم کنند. این روش در حوزه‌هایی مثل ریاضی، برنامه‌نویسی و استدلال منطقی که خط‌کش و معیار سنجش مشخصی دارند، به خوبی جواب می‌دهد.

ارزیابی این داده‌ها همیشه نیاز به نیروی انسانی ندارد و برنامه‌های نرم‌افزاری یا شبیه‌سازها هم می‌توانند کیفیت را بسنجند. اما در حوزه‌های پیچیده‌تر مثل پزشکی، ماجرا فرق می‌کند. در این حوزه‌ها بررسی خروجی هوش مصنوعی یا «ارائه بازخورد به سیستم»، هم زمان‌بر است و هم گران. سوال اصلی و اقتصادی این است: «به دست آوردن بازخورد قابل‌اعتماد برای سیستم، چقدر هزینه‌ برمی‌دارد؟» هر جا ارزیابی کیفیت به تخصص نایاب یا زمان طولانی نیاز داشته باشد، بازخورد گرفتن همچنان گران و سخت خواهد بود.

از سوی دیگر، ضبط و استفاده از قضاوت‌های انسانی، چالش‌های حقوقی و نظارتی نیز دارد، چرا که اصلاحات کارکنان و تعاملات مشتریان، حاوی اطلاعات محرمانه است و سازمان‌ها باید مجوزهای قانونی و کنترل‌های دسترسی لازم را برای استفاده مجدد از این داده‌ها دریافت کنند.

جمع‌آوری داده‌های عملکرد شرکتی معتبر

همزمان با فراگیر شدن مدل‌های پیشرفته، مسابقه بعدی داده‌ها در هوش مصنوعی، جمع‌آوری حجم بیشتر اطلاعات نیست بلکه دستیابی به شواهد معتبر از عملکرد خوب در محیط واقعی همان سازمان است.

این یعنی علم به اینکه کدام پیشنهادها در عمل موفق شدند، کدام‌ها شکست خوردند و کارشناسان چه پاسخی را رد کردند.

منبع: World Economic Forum