مدلهای زبانی فارسی
PartAI، PersianMind، چالشهای توکنسازی فارسی و آیندهٔ مدلهای بومی ایران.
مقالههای منتشرشده

مدل زبانی فارسی چیست
مدل زبانی فارسی یکی از مفاهیم پایهایه که اگه میخوای با LLM فارسی جدی کار کنی، باید قبل از هر چیز این رو دقیق بفهمی.

PartAI، مدل زبانی فارسی
وقتی صحبت از مدلهای زبانی بومی ایرانی میشه، PartAI یکی از معدود شرکتهاییه که نه فقط ادعا، بلکه مدل واقعی، با کد باز، منتشر کرده.

PersianMind؛ مدل زبانی فارسی و کاربردش
PersianMind چیست، چطور آموزش دیده، در چه کارهایی خوب است و کجا از مدلهای بزرگ جهانی عقب میماند.

ParsBERT؛ مدل فارسی BERT برای پردازش زبان
ParsBERT چیست، برای طبقهبندی و تحلیل احساسات فارسی چطور کار میکند و چه فرقی با مدلهای مولد مثل GPT دارد.

Llama fine-tuning برای فارسی
Llama یه مدل زبانی اوپنسورس از Metaه که هر کسی میتونه وزنهاش رو دانلود کنه، روی سرور خودش اجرا کنه، و، مهمتر از همه، روی دادههای خودش fine-tune کنه.

Tokenization فارسی
وقتی یه متن فارسی مینویسی و یه LLM پردازشش میکنه، اولین قدم، قبل از هر چیز، اینه که متن به تکههای کوچکتری تبدیل بشه. این فرآیند tokenization نام داره.

RTL و چالشهای زبان فارسی در LLM
وقتی یه جمله فارسی به ChatGPT یا Claude میفرستی، پشت پرده اتفاقی میافته که اغلب کاربران ازش بیخبرن: مدل جملهات رو به تکههای کوچیکتر به اسم «توکن» خرد…

بنچمارکهای فارسی، PersianBench و ParsiNLU
وقتی کسی ادعا میکنه مدلش «فارسی رو خوب میفهمه»، چطور میفهمی راسته؟ جواب: بنچمارک. جواب:…

دیتاستهای متن فارسی
وقتی از یه مدل زبانی میخوای فارسی بنویسه، درست استدلال کنه، یا حتی یه جمله را خوب تحلیل کنه، جواب سادهای وجود داره: کیفیت دیتاستی که روش آموزش دیده.

آیندهٔ هوش مصنوعی فارسی
هوش مصنوعی فارسی الان کجاست و به کجا میره؟ این سؤالیه که جواب دادنش در ۱۴۰۵ هم جذابتر شده، هم سختتر.