ارزیابی جامع کیفیت زبان فارسی در مدلهای برتر هوش مصنوعی (بنچمارک هوشباکس)
در عصر شکوفایی مدلهای بزرگ زبانی (LLMs)، اکثر ارزیابیهای معتبر بینالمللی نظیر MMLU، GSM8K و HumanEval بر مبنای زبان انگلیسی طراحی شدهاند. این امر باعث ایجاد یک خلأ شناختی بزرگ برای کاربران، توسعهدهندگان و شرکتهای ایرانی شده است: کدام مدل هوش مصنوعی زبان فارسی را واقعاً میفهمد و بدون لحن ماشینی، غلطهای املایی و ترجمههای تحتاللفظی خندهدار پاسخ میدهد؟
زبان فارسی به عنوان زبانی پیوندی، با خط راستبهچپ، دارای ویژگیهای صرفی و نحوی بسیار غنی، تنوع در کاربرد نیمفاصله، و وابستگی شدید به بافت فرهنگی و استعاری است. یک مدل زبانی برای موفقیت در پردازش زبان فارسی نه تنها باید دستور زبان و الفبای آن را بشناسد، بلکه باید از سد چالشهای عمیقتری همچون بهینگی توکنایزر، درک لحن مؤدبانه و رسمی (تعارفات و احترام) و ترجمه اصطلاحات عبور کند.
پلتفرم هوشباکس (Hooshbox) به عنوان مرجع تجمیع و ارائهدهنده بیش از ۴۰۰ مدل هوش مصنوعی در ایران، یک چارچوب ارزیابی پیوسته طراحی کرده است که تکتک مدلها را در جنبههای نگارشی، درک اصطلاحات بومی، کارایی توکنایزر و حل مسائل تخصصی میآزماید. در این گزارش تفصیلی، نتایج آخرین دور ارزیابی جامع پلتفرم بر روی 415 مدل فعال را تحلیل و کالبدشکافی میکنیم.
۱. چارچوب متدولوژی ۵ بعدی ارزیابی هوشباکس
سیستم سنجش هوشباکس مدلها را تنها با پرامپتهای ساده «سلام، چطوری؟» ارزیابی نمیکند؛ بلکه هر مدل در پنج محور مستقل و چالشبرانگیز مورد ارزیابی دقیق قرار میگیرد:
- صحت صرفی، نحوی و انسجام جملات مرکب (Morphosyntax):
بررسی انطباق دقیق شناسه فعل با فاعل در جملات بلند، مدیریت افعال مرکب چندجزئی (نظیر «به نتیجه رساندن» یا «از پای درآوردن»)، و حفظ زمان افعال ترکیبی (ماضی نقلی، استمراری و التزامی). - رسمالخط مصوب، نیمفاصله و تمایز حروف (Orthography & ZWNJ):
توانایی اعمال نیمفاصله (Zero-Width Non-Joiner) در واژگان جمع (ها)، پیشوندهای فعلی (می/نمی) و کلمات مرکب؛ همچنین پالایش خودکار حروف عربی غیرمعمول در فارسی معاصر (مانند «ي» و «ك» به جای «ی» و «ک»). - درک کنایات، ضربالمثلها و بار فرهنگی (Pragmatics & Idiomatic Nuance):
آزمون مدل در مواجهه با استعارههای اصیل نظیر «دستتنها بودن»، «گوش خواباندن»، «کاسه داغتر از آش شدن» و مفاهیم ویژه تعارف، برای سنجش توانایی تشخیص منظور واقعی در برابر ترجمه واژهبهواژه. - راندمان توکنایزر و نسبت توکن به کلمه (Tokenization Efficiency):
سنجش تعداد توکنهای مصرفی به ازای هر کلمه فارسی. مدلهایی که دایره واژگان متنی ضعیفی برای خط فارسی دارند، هر کلمه را به چندین کاراکتر و بایت خرد کرده و منجر به افت سرعت پاسخدهی و افزایش چندبرابری هزینه پردازش کاربر میشوند. - استدلال علمی، نگارش حقوقی و ترجمه متون مهندسی (Domain-Specific Reasoning):
سنجش درک متون تخصصی شامل اصطلاحات علوم پزشکی، فرمولهای ریاضیاتی و منطقی، قراردادهای حقوقی و معماری کد، بدون افتادن در دام اختراع واژگان نامفهوم یا ابهامآفرین.
۲. آمار کلان ارزیابی استخر مدلهای هوشباکس
در جدیدترین پایش هوشباکس، وضعیت عملکرد 415 مدل زبانی استخراج و ردهبندی شده است:
| سطح کیفی زبان فارسی | تعداد مدلها | درصد از کل استخر مدلها | وضعیت و پایداری در تسکهای فارسی |
|---|---|---|---|
| فارسی عالی و خوب (پیشنهاد هوشباکس) | 311 مدل | 74٪ | پاسخدهی کاملاً سلیس، بدون غلط املایی فاحش، درک قوی بافت و لحن |
| فارسی متوسط | 17 مدل | 4٪ | درک مناسب در متون کوتاه؛ افت نگارش در جملات پیچیده یا کنایات سنتی |
| فارسی ضعیف | 10 مدل | 2٪ | ناتوانی در رعایت دستور زبان، خردشدن شدید حروف، لحن ماشینی و گسسته |
| خطای اتصال یا عدم پاسخ پایدار | 77 مدل | 18٪ | مدلهای متوقفشده یا دارای خطای شبکه در ارزیابی خودکار |
یافته کلیدی پژوهش: در مقایسه با ارزیابی سال گذشته، سهم مدلهای با «فارسی خوب» از ۵۲ درصد به بیش از 74 درصد رسیده است. علت اصلی این جهش، بهکارگیری توکنایزرهای چندزبانه بزرگتر (مانند توکنایزرهای ۱۲۸ هزارتایی Tiktoken و توکنایزرهای جدید خانواده Qwen و Tencent) و غنیتر شدن مجموعه دادههای چندزبانه در فرآیند پیشآموزش مدلها است.
۳. جدول مقایسه عملکرد مدلهای پرچمدار و منتخب
جدول زیر گلچینی از محبوبترین و پرکاربردترین مدلهای موجود در پلتفرم هوشباکس را همراه با سطح کیفی ارزیابیشده و ارزیابی تحلیلی تیم پژوهش نشان میدهد:
| نام تجاری مدل | شناسه مدل (Model Slug) | ارزیابی کیفی هوشباکس | تحلیل و ارزیابی تخصصی |
|---|---|---|---|
| Claude 4 Opus (Anthropic) | anthropic/claude-opus-4 | فارسی خوب | فوقالعاده روان و ادیبانه؛ درک عمیق اصطلاحات، لحن طبیعی و رعایت استثنایی نیمفاصله و دستور زبان |
| GPT-4.1 (OpenAI) | openai/gpt-4.1 | فارسی خوب | تسلط بینظیر بر صرف و نحو، گستره واژگانی وسیع و استدلال عالی در متون حقوقی، مالی و آکادمیک |
| o4-mini (OpenAI) | openai/o4-mini | فارسی خوب | پاسخدهی ساختاریافته، سرعت پردازش بالا و توانایی حل مسائل پیچیده فنی و برنامهنویسی به فارسی |
| o3-mini High (OpenAI) | openai/o3-mini-high | فارسی خوب | استدلال منطقی مرحلهبهمرحله عالی در پردازش پرامپتهای مهندسی و مستندات فنی فارسی |
| Sonar Pro (Perplexity) | perplexity/sonar-pro | فارسی خوب | ترکیب جستجوی برخط وب با درک فارسی سلیس؛ ایدهآل برای پژوهشهای میدانی و خلاصهسازی اخبار |
| Command R+ (Cohere) | cohere/command-r-plus-08-2024 | فارسی خوب | بهینهسازی کمنظیر برای بازیابی اطلاعات (RAG) و استخراج داده از اسناد اداری و حقوقی فارسی |
| Hunyuan MT2 30B (Tencent) | tencent/hy-mt2-30b-a3b | فارسی خوب | درک عمیق ساختارهای نحوی پیچیده جملات مرکب و ترجمه دقیق دوطرفه انگلیسی به فارسی |
| Hunyuan MT2 7B (Tencent) | tencent/hy-mt2-7b | فارسی خوب | مدل سبک و اقتصادی، کارایی بالا در ترجمه محاورهای و پردازش متون چتباتهای روزمره |
| Seed 2.1 Turbo (ByteDance) | bytedance-seed/seed-2-1-turbo | فارسی خوب | سرعت توکنریزی سریع و عملکرد مطلوب در مکالمات محاورهای و پاسخ به سوالات پربسامد |
| GPT-3.5 Turbo (OpenAI) | gpt-3.5-turbo-0125 | فارسی خوب | پایداری مطلوب در مکالمات ساده، گرچه در کنایات و امثال سنتی فارسی گاهی دچار تحتاللفظیگرایی میشود |
| Dots 3 Note Preview | dots-studio/dots-3-note-preview:free | فارسی خوب | کیفیت مناسب و اقتصادی در خلاصهسازی نکات کلیدی، یادداشتبرداری و صورتجلسات فارسی |
۴. کالبدشکافی خانوادههای بزرگ زبانی در زبان فارسی
تحلیل مقایسهای رفتار مدلها نشان میدهد که شرکتهای مختلف، رویکردهای متفاوتی در مواجهه با زبان فارسی داشتهاند:
الف) خانواده Anthropic (سری Claude)؛ سرآمد در شیوایی و نگارش ادبی
مدلهای خانواده کلود (بهویژه Claude 4 Opus و Claude 3.5 Sonnet) بدون شک طبیعیترین و ادیبانهترین خروجی زبان فارسی را تولید میکنند:
- نقطه قوت: لحن پاسخها خشک و رباتگونه نیست. مدل تفاوت بین نگارش رسمی، دانشگاهی و مکاتبات دوستانه را بهخوبی درک میکند.
- رعایت علائم نگارشی: استفاده خودکار و دقیق از نیمفاصله، نقطهگذاری صحیح و پرهیز از تکرارهای خستهکننده از ویژگیهای برجسته این خانواده است.
- کاربرد بهینه: تولید مقاله، ترجمه کتاب، کپیرایتینگ تبلیغاتی و نامهنگاری اداری حساس.
ب) خانواده OpenAI (مدلهای GPT-4.1 و سری استدلالی o)؛ پیشتاز در حل مسئله و ریاضیات
اوپنایآی همواره استانداردهای استدلال منطقی را تعیین کرده و این قدرت در زبان فارسی نیز مشهود است:
- نقطه قوت: توانایی فوقالعاده در پردازش مسائل چندمرحلهای، درک کدهای برنامهنویسی و مستندات نرمافزاری به زبان فارسی.
- مدلهای استدلالی o4-mini و o3-mini: در حل مسائل الگوریتمی و استنتاجهای حقوقی به زبان فارسی با ساختاربندی دقیق خروجی میدهند.
- نکته قابل توجه: گاهی لحن مدل کمی بیش از حد آکادمیک یا شبیه به ترجمه استانداردهای بینالمللی است، اما از نظر دقت علمی بیرقیب است.
ج) مدلهای آسیایی و متنباز (Tencent Hunyuan, Qwen, DeepSeek)؛ غافلگیری بزرگ ترجمه
طی ماههای اخیر، مدلهای توسعهیافته توسط شرکتهای چینی پیشرفت خیرهکنندهای در زبانهای خاورمیانه نشان دادهاند:
- سری Tencent Hunyuan MT2: این مدلها به طور تخصصی برای ترجمه ماشینی چندزبانه بهینهسازی شدهاند و توانایی خیرهکنندهای در برگردان اصطلاحات عامیانه انگلیسی به فارسی محاورهای روان دارند.
- سری Qwen و DeepSeek: بهینهسازی فوقالعاده توکنایزر سبب شده این مدلها هم از نظر سرعت تولید و هم از نظر صرفه اقتصادی در پردازش دادههای بزرگ فارسی بسیار موفق عمل کنند.
۵. بحران پنهان توکنایزرها در خط فارسی: چرا هزینه پردازش شما ممکن است ۳ برابر باشد؟
یکی از حقایق نادیدهگرفتهشده در پردازش زبان طبیعی، معماری توکنایزر (Tokenizer Architecture) است:
در زبان انگلیسی، هر کلمه به طور میانگین معادل ۱ تا ۱.۳ توکن است. اما در خط فارسی، به دلیل عدم اختصاص فضای کافی در دایره واژگان مدلهای قدیمیتر:
- در مدلهای قدیمی (مانند GPT-3 اولیه یا برخی مدلهای LLaMA اولیه)، یک واژه ساده مثل «میخواهم» به ۵ تا ۸ توکن بایت مجزا خرد میشد.
- این یعنی برای یک متن یکسان، کاربر ایرانی ۳ تا ۴ برابر بیشتر هزینه توکن پرداخت میکرد و سرعت پاسخ مدل نیز به یکسوم کاهش مییافت!
- در نسل جدید مدلها (مانند GPT-4.1 و Claude 4 و Hunyuan MT2): نسبت توکن به کلمه برای خط فارسی به حدود ۱.۴ تا ۱.۸ کاهش یافته است که صرفهجویی اقتصادی عظیمی برای کسبوکارهای متکی بر هوش مصنوعی ایجاد میکند.
۶. سه آسیبشناسی بنیادین در مدلهای رده متوسط و ضعیف
مدلهایی که در ردهبندی هوشباکس امتیاز «متوسط» یا «ضعیف» دریافت کردهاند، در سه تله ساختاری گرفتار میشوند:
- تحتاللفظیگرایی و از بین رفتن مقصود گوینده:
وقتی به مدلی ضعیف عبارت «طرف موش دووند» داده میشود، به جای استنباط اخلالگری و کارشکنی، پاسخی درباره جوندگان ارائه میدهد! - گسست نحوی در بندهای بلند (Syntactic Drift):
در تولید متون طولانیتر از ۶۰۰ کلمه، مدلهای ضعیفتر اتصال فاعل اول جمله را با فعل پایانی گم کرده و با تغییر بیدلیل زمان یا شخص فعل، انسجام متن را تخریب میکنند. - آلودگی کاراکتری با حروف عربی و نفی نیمفاصلهها:
چسباندن ناهنجار واژگان (مانند «کتابها» یا «میروم») یا جایگزینی حرف «ی» با «ي» دارای دونقطه زیرین، خروجی را برای چاپ رسمی یا انتشار در وبسایتهای تجاری نامناسب میسازد.
۷. راهنمای کاربردی: برای هر نیاز، کدام مدل را انتخاب کنیم؟
بر پایه ارزیابیهای میدانی تیم پژوهش هوشباکس، ماتریس انتخاب بهینه به شرح زیر است:
- کپیرایتینگ، سناریونویسی و محتوای شبکههای اجتماعی:
انتخاب اول: Claude 4 Opus یا Claude 3.5 Sonnet (به دلیل لحن گرم، انسانی و دایره لغات متنوع). - تحلیل قراردادهای تجاری، گزارشهای مالی و استدلال حقوقی:
انتخاب اول: GPT-4.1 یا o4-mini (به دلیل دقت ریاضی، پرهیز از توهم و استدلال گامبهگام). - چتباتهای پشتیبانی مشتریان ۲۴ ساعته (سرعت بالا و هزینه کم):
انتخاب اول: Hunyuan MT2 7B یا Seed 2.1 Turbo (توازن عالی بین سرعت، هزینه اقتصادی و درک محاورهای). - تحقیق و جمعآوری اطلاعات موثق از وب با زبان فارسی:
انتخاب اول: Perplexity Sonar Pro (ترکیب جستجوی لایو با زبان فارسی پاکیزه و ارائه مراجع معتبر).
۸. زیرساخت هوشباکس چگونه چالشهای زبان فارسی را حل میکند؟
کاربران پلتفرم هوشباکس نیازی به حدس زدن یا آزمونوخطای هزینهبر ندارند؛ زیرساخت پلتفرم این مسیر را با سه امکان اساسی هموار کرده است:
- برچسبگذاری کیفی هوشمند در ماژول چت: تمامی ۴۰۰+ مدل در پلتفرم به صورت خودکار برچسبگذاری شدهاند تا کاربران همواره با فیلتر سریع به مدلهای با «فارسی خوب» دسترسی داشته باشند.
- میزگرد هوش مصنوعی چندمدلی (Roundtable Debate):
میتوانید همزمان چند مدل برتر (مثلاً کلود، GPT و هونیوان) را دور یک میز بنشانید. مدلها پاسخهای یکدیگر را نقد، خطاهای زبانی و نگارشی را تصحیح، و در پایان جامعترین سنتز را به زبان فارسی ارائه میکنند. - دستیار هوشمند ساخت نرمافزار (AI Software Builder):
در ماژول دستیار ساخت، موتور سیستم بر پایه مدلهای ارشد بهینهسازی شده برای فارسی عمل میکند؛ به طوری که ایدههای خام به زبان عامیانه فارسی دریافت شده و به اسناد نیازمندیها، بلوپرینتهای معماری و رابطهای کاربری بدون نقص تبدیل میشوند.
نتیجهگیری و چشمانداز آینده
تسلط بر زبان فارسی دیگر یک مزیت فانتزی نیست، بلکه پیششرط اساسی بهکارگیری مؤثر هوش مصنوعی در سازمانها، استارتاپها و پروژههای شخصی در ایران است. دادههای بنچمارک هوشباکس گواهی میدهند که رقابت میان توسعهدهندگان تراز اول جهانی، کیفیت پردازش خط فارسی را به بالاترین سطح تاریخی خود رسانده است.
با استفاده از مدلهای پرچمدار شناساییشده در این گزارش و تکیه بر ابزارهای هوشباکس، میتوانید با اطمینان کامل از هوش مصنوعی برای تولید متون فاخر، تحلیل دادههای حساس و توسعه سامانههای مدرن بهرهمند شوید.