تست کیفیت مدل‌ها۱۴۰۵/۶/۲۰تیم پژوهشی هوش‌باکس

ارزیابی جامع کیفیت زبان فارسی در مدل‌های برتر هوش مصنوعی (بنچ‌مارک هوش‌باکس)

گزارش تحلیلی و مقایسه‌ای جامع از عملکرد 415 مدل زبانی روز دنیا در درک، نگارش، کارایی توکنایزر و تطبیق فرهنگی زبان فارسی، بر پایه ارزیابی خودکار پلتفرم هوش‌باکس.

ارزیابی جامع کیفیت زبان فارسی در مدل‌های برتر هوش مصنوعی (بنچ‌مارک هوش‌باکس)

در عصر شکوفایی مدل‌های بزرگ زبانی (LLMs)، اکثر ارزیابی‌های معتبر بین‌المللی نظیر MMLU، GSM8K و HumanEval بر مبنای زبان انگلیسی طراحی شده‌اند. این امر باعث ایجاد یک خلأ شناختی بزرگ برای کاربران، توسعه‌دهندگان و شرکت‌های ایرانی شده است: کدام مدل هوش مصنوعی زبان فارسی را واقعاً می‌فهمد و بدون لحن ماشینی، غلط‌های املایی و ترجمه‌های تحت‌اللفظی خنده‌دار پاسخ می‌دهد؟

زبان فارسی به عنوان زبانی پیوندی، با خط راست‌به‌چپ، دارای ویژگی‌های صرفی و نحوی بسیار غنی، تنوع در کاربرد نیم‌فاصله، و وابستگی شدید به بافت فرهنگی و استعاری است. یک مدل زبانی برای موفقیت در پردازش زبان فارسی نه تنها باید دستور زبان و الفبای آن را بشناسد، بلکه باید از سد چالش‌های عمیق‌تری همچون بهینگی توکنایزر، درک لحن مؤدبانه و رسمی (تعارفات و احترام) و ترجمه اصطلاحات عبور کند.

پلتفرم هوش‌باکس (Hooshbox) به عنوان مرجع تجمیع و ارائه‌دهنده بیش از ۴۰۰ مدل هوش مصنوعی در ایران، یک چارچوب ارزیابی پیوسته طراحی کرده است که تک‌تک مدل‌ها را در جنبه‌های نگارشی، درک اصطلاحات بومی، کارایی توکنایزر و حل مسائل تخصصی می‌آزماید. در این گزارش تفصیلی، نتایج آخرین دور ارزیابی جامع پلتفرم بر روی 415 مدل فعال را تحلیل و کالبدشکافی می‌کنیم.


۱. چارچوب متدولوژی ۵ بعدی ارزیابی هوش‌باکس

سیستم سنجش هوش‌باکس مدل‌ها را تنها با پرامپت‌های ساده «سلام، چطوری؟» ارزیابی نمی‌کند؛ بلکه هر مدل در پنج محور مستقل و چالش‌برانگیز مورد ارزیابی دقیق قرار می‌گیرد:

  1. صحت صرفی، نحوی و انسجام جملات مرکب (Morphosyntax):
    بررسی انطباق دقیق شناسه فعل با فاعل در جملات بلند، مدیریت افعال مرکب چندجزئی (نظیر «به نتیجه رساندن» یا «از پای درآوردن»)، و حفظ زمان افعال ترکیبی (ماضی نقلی، استمراری و التزامی).
  2. رسم‌الخط مصوب، نیم‌فاصله و تمایز حروف (Orthography & ZWNJ):
    توانایی اعمال نیم‌فاصله (Zero-Width Non-Joiner) در واژگان جمع (ها)، پیشوندهای فعلی (می/نمی) و کلمات مرکب؛ همچنین پالایش خودکار حروف عربی غیرمعمول در فارسی معاصر (مانند «ي» و «ك» به جای «ی» و «ک»).
  3. درک کنایات، ضرب‌المثل‌ها و بار فرهنگی (Pragmatics & Idiomatic Nuance):
    آزمون مدل در مواجهه با استعاره‌های اصیل نظیر «دست‌تنها بودن»، «گوش خواباندن»، «کاسه داغ‌تر از آش شدن» و مفاهیم ویژه تعارف، برای سنجش توانایی تشخیص منظور واقعی در برابر ترجمه واژه‌به‌واژه.
  4. راندمان توکنایزر و نسبت توکن به کلمه (Tokenization Efficiency):
    سنجش تعداد توکن‌های مصرفی به ازای هر کلمه فارسی. مدل‌هایی که دایره واژگان متنی ضعیفی برای خط فارسی دارند، هر کلمه را به چندین کاراکتر و بایت خرد کرده و منجر به افت سرعت پاسخ‌دهی و افزایش چندبرابری هزینه پردازش کاربر می‌شوند.
  5. استدلال علمی، نگارش حقوقی و ترجمه متون مهندسی (Domain-Specific Reasoning):
    سنجش درک متون تخصصی شامل اصطلاحات علوم پزشکی، فرمول‌های ریاضیاتی و منطقی، قراردادهای حقوقی و معماری کد، بدون افتادن در دام اختراع واژگان نامفهوم یا ابهام‌آفرین.

۲. آمار کلان ارزیابی استخر مدل‌های هوش‌باکس

در جدیدترین پایش هوش‌باکس، وضعیت عملکرد 415 مدل زبانی استخراج و رده‌بندی شده است:

سطح کیفی زبان فارسیتعداد مدل‌هادرصد از کل استخر مدل‌هاوضعیت و پایداری در تسک‌های فارسی
فارسی عالی و خوب (پیشنهاد هوش‌باکس)311 مدل74٪پاسخ‌دهی کاملاً سلیس، بدون غلط املایی فاحش، درک قوی بافت و لحن
فارسی متوسط17 مدلدرک مناسب در متون کوتاه؛ افت نگارش در جملات پیچیده یا کنایات سنتی
فارسی ضعیف10 مدلناتوانی در رعایت دستور زبان، خردشدن شدید حروف، لحن ماشینی و گسسته
خطای اتصال یا عدم پاسخ پایدار77 مدل18٪مدل‌های متوقف‌شده یا دارای خطای شبکه در ارزیابی خودکار

یافته کلیدی پژوهش: در مقایسه با ارزیابی سال گذشته، سهم مدل‌های با «فارسی خوب» از ۵۲ درصد به بیش از 74 درصد رسیده است. علت اصلی این جهش، به‌کارگیری توکنایزرهای چندزبانه بزرگ‌تر (مانند توکنایزرهای ۱۲۸ هزارتایی Tiktoken و توکنایزرهای جدید خانواده Qwen و Tencent) و غنی‌تر شدن مجموعه داده‌های چندزبانه در فرآیند پیش‌آموزش مدل‌ها است.


۳. جدول مقایسه عملکرد مدل‌های پرچم‌دار و منتخب

جدول زیر گلچینی از محبوب‌ترین و پرکاربردترین مدل‌های موجود در پلتفرم هوش‌باکس را همراه با سطح کیفی ارزیابی‌شده و ارزیابی تحلیلی تیم پژوهش نشان می‌دهد:

نام تجاری مدلشناسه مدل (Model Slug)ارزیابی کیفی هوش‌باکستحلیل و ارزیابی تخصصی
Claude 4 Opus (Anthropic)anthropic/claude-opus-4فارسی خوبفوق‌العاده روان و ادیبانه؛ درک عمیق اصطلاحات، لحن طبیعی و رعایت استثنایی نیم‌فاصله و دستور زبان
GPT-4.1 (OpenAI)openai/gpt-4.1فارسی خوبتسلط بی‌نظیر بر صرف و نحو، گستره واژگانی وسیع و استدلال عالی در متون حقوقی، مالی و آکادمیک
o4-mini (OpenAI)openai/o4-miniفارسی خوبپاسخ‌دهی ساختاریافته، سرعت پردازش بالا و توانایی حل مسائل پیچیده فنی و برنامه‌نویسی به فارسی
o3-mini High (OpenAI)openai/o3-mini-highفارسی خوباستدلال منطقی مرحله‌به‌مرحله عالی در پردازش پرامپت‌های مهندسی و مستندات فنی فارسی
Sonar Pro (Perplexity)perplexity/sonar-proفارسی خوبترکیب جستجوی برخط وب با درک فارسی سلیس؛ ایده‌آل برای پژوهش‌های میدانی و خلاصه‌سازی اخبار
Command R+ (Cohere)cohere/command-r-plus-08-2024فارسی خوببهینه‌سازی کم‌نظیر برای بازیابی اطلاعات (RAG) و استخراج داده از اسناد اداری و حقوقی فارسی
Hunyuan MT2 30B (Tencent)tencent/hy-mt2-30b-a3bفارسی خوبدرک عمیق ساختارهای نحوی پیچیده جملات مرکب و ترجمه دقیق دوطرفه انگلیسی به فارسی
Hunyuan MT2 7B (Tencent)tencent/hy-mt2-7bفارسی خوبمدل سبک و اقتصادی، کارایی بالا در ترجمه محاوره‌ای و پردازش متون چت‌بات‌های روزمره
Seed 2.1 Turbo (ByteDance)bytedance-seed/seed-2-1-turboفارسی خوبسرعت توکن‌ریزی سریع و عملکرد مطلوب در مکالمات محاوره‌ای و پاسخ به سوالات پربسامد
GPT-3.5 Turbo (OpenAI)gpt-3.5-turbo-0125فارسی خوبپایداری مطلوب در مکالمات ساده، گرچه در کنایات و امثال سنتی فارسی گاهی دچار تحت‌اللفظی‌گرایی می‌شود
Dots 3 Note Previewdots-studio/dots-3-note-preview:freeفارسی خوبکیفیت مناسب و اقتصادی در خلاصه‌سازی نکات کلیدی، یادداشت‌برداری و صورت‌جلسات فارسی

۴. کالبدشکافی خانواده‌های بزرگ زبانی در زبان فارسی

تحلیل مقایسه‌ای رفتار مدل‌ها نشان می‌دهد که شرکت‌های مختلف، رویکردهای متفاوتی در مواجهه با زبان فارسی داشته‌اند:

الف) خانواده Anthropic (سری Claude)؛ سرآمد در شیوایی و نگارش ادبی

مدل‌های خانواده کلود (به‌ویژه Claude 4 Opus و Claude 3.5 Sonnet) بدون شک طبیعی‌ترین و ادیبانه‌ترین خروجی زبان فارسی را تولید می‌کنند:

  • نقطه قوت: لحن پاسخ‌ها خشک و ربات‌گونه نیست. مدل تفاوت بین نگارش رسمی، دانشگاهی و مکاتبات دوستانه را به‌خوبی درک می‌کند.
  • رعایت علائم نگارشی: استفاده خودکار و دقیق از نیم‌فاصله، نقطه‌گذاری صحیح و پرهیز از تکرارهای خسته‌کننده از ویژگی‌های برجسته این خانواده است.
  • کاربرد بهینه: تولید مقاله، ترجمه کتاب، کپی‌رایتینگ تبلیغاتی و نامه‌نگاری اداری حساس.

ب) خانواده OpenAI (مدل‌های GPT-4.1 و سری استدلالی o)؛ پیشتاز در حل مسئله و ریاضیات

اوپن‌ای‌آی همواره استانداردهای استدلال منطقی را تعیین کرده و این قدرت در زبان فارسی نیز مشهود است:

  • نقطه قوت: توانایی فوق‌العاده در پردازش مسائل چندمرحله‌ای، درک کدهای برنامه‌نویسی و مستندات نرم‌افزاری به زبان فارسی.
  • مدل‌های استدلالی o4-mini و o3-mini: در حل مسائل الگوریتمی و استنتاج‌های حقوقی به زبان فارسی با ساختاربندی دقیق خروجی می‌دهند.
  • نکته قابل توجه: گاهی لحن مدل کمی بیش از حد آکادمیک یا شبیه به ترجمه استانداردهای بین‌المللی است، اما از نظر دقت علمی بی‌رقیب است.

ج) مدل‌های آسیایی و متن‌باز (Tencent Hunyuan, Qwen, DeepSeek)؛ غافلگیری بزرگ ترجمه

طی ماه‌های اخیر، مدل‌های توسعه‌یافته توسط شرکت‌های چینی پیشرفت خیره‌کننده‌ای در زبان‌های خاورمیانه نشان داده‌اند:

  • سری Tencent Hunyuan MT2: این مدل‌ها به طور تخصصی برای ترجمه ماشینی چندزبانه بهینه‌سازی شده‌اند و توانایی خیره‌کننده‌ای در برگردان اصطلاحات عامیانه انگلیسی به فارسی محاوره‌ای روان دارند.
  • سری Qwen و DeepSeek: بهینه‌سازی فوق‌العاده توکنایزر سبب شده این مدل‌ها هم از نظر سرعت تولید و هم از نظر صرفه اقتصادی در پردازش داده‌های بزرگ فارسی بسیار موفق عمل کنند.

۵. بحران پنهان توکنایزرها در خط فارسی: چرا هزینه پردازش شما ممکن است ۳ برابر باشد؟

یکی از حقایق نادیده‌گرفته‌شده در پردازش زبان طبیعی، معماری توکنایزر (Tokenizer Architecture) است:

در زبان انگلیسی، هر کلمه به طور میانگین معادل ۱ تا ۱.۳ توکن است. اما در خط فارسی، به دلیل عدم اختصاص فضای کافی در دایره واژگان مدل‌های قدیمی‌تر:

  • در مدل‌های قدیمی (مانند GPT-3 اولیه یا برخی مدل‌های LLaMA اولیه)، یک واژه ساده مثل «می‌خواهم» به ۵ تا ۸ توکن بایت مجزا خرد می‌شد.
  • این یعنی برای یک متن یکسان، کاربر ایرانی ۳ تا ۴ برابر بیشتر هزینه توکن پرداخت می‌کرد و سرعت پاسخ مدل نیز به یک‌سوم کاهش می‌یافت!
  • در نسل جدید مدل‌ها (مانند GPT-4.1 و Claude 4 و Hunyuan MT2): نسبت توکن به کلمه برای خط فارسی به حدود ۱.۴ تا ۱.۸ کاهش یافته است که صرفه‌جویی اقتصادی عظیمی برای کسب‌وکارهای متکی بر هوش مصنوعی ایجاد می‌کند.

۶. سه آسیب‌شناسی بنیادین در مدل‌های رده متوسط و ضعیف

مدل‌هایی که در رده‌بندی هوش‌باکس امتیاز «متوسط» یا «ضعیف» دریافت کرده‌اند، در سه تله ساختاری گرفتار می‌شوند:

  1. تحت‌اللفظی‌گرایی و از بین رفتن مقصود گوینده:
    وقتی به مدلی ضعیف عبارت «طرف موش دووند» داده می‌شود، به جای استنباط اخلالگری و کارشکنی، پاسخی درباره جوندگان ارائه می‌دهد!
  2. گسست نحوی در بندهای بلند (Syntactic Drift):
    در تولید متون طولانی‌تر از ۶۰۰ کلمه، مدل‌های ضعیف‌تر اتصال فاعل اول جمله را با فعل پایانی گم کرده و با تغییر بی‌دلیل زمان یا شخص فعل، انسجام متن را تخریب می‌کنند.
  3. آلودگی کاراکتری با حروف عربی و نفی نیم‌فاصله‌ها:
    چسباندن ناهنجار واژگان (مانند «کتابها» یا «میروم») یا جایگزینی حرف «ی» با «ي» دارای دونقطه زیرین، خروجی را برای چاپ رسمی یا انتشار در وب‌سایت‌های تجاری نامناسب می‌سازد.

۷. راهنمای کاربردی: برای هر نیاز، کدام مدل را انتخاب کنیم؟

بر پایه ارزیابی‌های میدانی تیم پژوهش هوش‌باکس، ماتریس انتخاب بهینه به شرح زیر است:

  • کپی‌رایتینگ، سناریونویسی و محتوای شبکه‌های اجتماعی:
    انتخاب اول: Claude 4 Opus یا Claude 3.5 Sonnet (به دلیل لحن گرم، انسانی و دایره لغات متنوع).
  • تحلیل قراردادهای تجاری، گزارش‌های مالی و استدلال حقوقی:
    انتخاب اول: GPT-4.1 یا o4-mini (به دلیل دقت ریاضی، پرهیز از توهم و استدلال گام‌به‌گام).
  • چت‌بات‌های پشتیبانی مشتریان ۲۴ ساعته (سرعت بالا و هزینه کم):
    انتخاب اول: Hunyuan MT2 7B یا Seed 2.1 Turbo (توازن عالی بین سرعت، هزینه اقتصادی و درک محاوره‌ای).
  • تحقیق و جمع‌آوری اطلاعات موثق از وب با زبان فارسی:
    انتخاب اول: Perplexity Sonar Pro (ترکیب جستجوی لایو با زبان فارسی پاکیزه و ارائه مراجع معتبر).

۸. زیرساخت هوش‌باکس چگونه چالش‌های زبان فارسی را حل می‌کند؟

کاربران پلتفرم هوش‌باکس نیازی به حدس زدن یا آزمون‌وخطای هزینه‌بر ندارند؛ زیرساخت پلتفرم این مسیر را با سه امکان اساسی هموار کرده است:

  • برچسب‌گذاری کیفی هوشمند در ماژول چت: تمامی ۴۰۰+ مدل در پلتفرم به صورت خودکار برچسب‌گذاری شده‌اند تا کاربران همواره با فیلتر سریع به مدل‌های با «فارسی خوب» دسترسی داشته باشند.
  • میزگرد هوش مصنوعی چندمدلی (Roundtable Debate):
    می‌توانید همزمان چند مدل برتر (مثلاً کلود، GPT و هونیوان) را دور یک میز بنشانید. مدل‌ها پاسخ‌های یکدیگر را نقد، خطاهای زبانی و نگارشی را تصحیح، و در پایان جامع‌ترین سنتز را به زبان فارسی ارائه می‌کنند.
  • دستیار هوشمند ساخت نرم‌افزار (AI Software Builder):
    در ماژول دستیار ساخت، موتور سیستم بر پایه مدل‌های ارشد بهینه‌سازی شده برای فارسی عمل می‌کند؛ به طوری که ایده‌های خام به زبان عامیانه فارسی دریافت شده و به اسناد نیازمندی‌ها، بلوپرینت‌های معماری و رابط‌های کاربری بدون نقص تبدیل می‌شوند.

نتیجه‌گیری و چشم‌انداز آینده

تسلط بر زبان فارسی دیگر یک مزیت فانتزی نیست، بلکه پیش‌شرط اساسی به‌کارگیری مؤثر هوش مصنوعی در سازمان‌ها، استارتاپ‌ها و پروژه‌های شخصی در ایران است. داده‌های بنچ‌مارک هوش‌باکس گواهی می‌دهند که رقابت میان توسعه‌دهندگان تراز اول جهانی، کیفیت پردازش خط فارسی را به بالاترین سطح تاریخی خود رسانده است.

با استفاده از مدل‌های پرچم‌دار شناسایی‌شده در این گزارش و تکیه بر ابزارهای هوش‌باکس، می‌توانید با اطمینان کامل از هوش مصنوعی برای تولید متون فاخر، تحلیل داده‌های حساس و توسعه سامانه‌های مدرن بهره‌مند شوید.

آزمایش مدل‌ها در عمل

همین حالا مدل‌های برتر را در هوش‌باکس تجربه کنید

با هوش‌باکس می‌توانید بیش از ۴۰۰ مدل هوش مصنوعی روز دنیا را با هم مقایسه کنید، در میزگرد همزمان به مباحثه بگذارید، یا پروژه‌های نرم‌افزاری بسازید.