Mistral Moderation 2؛ بررسی فیلتر ایمنی رایگان با تشخیص Jailbreak و Context بلند
آخرین راستیآزمایی: ۱۳ سپتامبر ۲۰۲۶
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: براساس صفحه رسمی قیمت Mistral و مدل Moderation 2، در ۱۳ سپتامبر ۲۰۲۶ استفاده API این Classifier رایگان است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.
مقدمه؛ فیلتر محتوا یک دکمه روشن و خاموش نیست
وقتی یک Chatbot یا Agent عمومی میشود، سؤال فقط این نیست که مدل پاسخ خوبی میدهد یا نه. ورودی میتواند حاوی تهدید، اطلاعات شخصی، درخواست خودآسیبی یا تلاش برای دور زدن دستورهای ایمنی باشد؛ خروجی نیز ممکن است بدون کنترل به کاربر برسد. اینجا یک مدل Moderation نقش لایه تشخیص را دارد.
Mistral Moderation 2 نسل دوم سرویس تعدیل محتوای Mistral AI است. این مدل متن خام یا مکالمه چندمرحلهای را در ۱۱ Category بررسی و برای هر Category Score و تصمیم نقض Policy برمیگرداند. Context رسمی ۱۲۸K به آن اجازه میدهد خطر را در History بلند ببیند، نه فقط در آخرین جمله.
قابلیت برجسته نسل دوم، تشخیص Jailbreak و اضافه شدن Categoryهای dangerous و criminal است. API در زمان بررسی رایگان است و میتوان آن را مستقل فراخوانی کرد یا بهصورت Inline guardrail جلوی Chat Completions، Conversation و Agent قرار داد. بااینحال هیچ Classifier ایمنی بهتنهایی Policy، نیروی انسانی و Monitoring را جایگزین نمیکند.
Mistral Moderation 2 چیست؟
Mistral Moderation 2 یک مدل تخصصی Text classification است، نه مدل تولید متن. ورودی را میخواند و احتمال/Score چند نوع ریسک را برمیگرداند. Endpoint نسخهای mistral-moderation-2603 در صفحه رسمی با وضعیت GA و طبقه Premier ثبت شده است.
تاریخ صفحه مدل ۱ مارس ۲۰۲۶ است و Mistral معرفی عمومی را در ۱۷ مارس منتشر کرد. نسل قبلی با شناسه mistral-moderation-2411 در ۳۱ مارس ۲۰۲۶ Deprecated شد و مستندات، Moderation 2 را جایگزین Integration جدید معرفی میکنند.
این سرویس دو روش استفاده اصلی دارد:
- Moderation API مستقل: برای دریافت Raw score و کنترل Threshold در Pipeline خودتان؛
- Custom Guardrails: برای تعریف Category و Threshold داخل درخواست Chat/Conversation/Agent و Block خودکار پیش از رسیدن ورودی به مدل اصلی.
در هر دو حالت، Policy محصول باید مشخص کند با هر نتیجه چه اتفاقی میافتد: Allow، Warn، Age gate، Redact، محدود کردن Tool یا ارجاع به انسان. مدل صرفاً Signal میدهد.
جایگاه مدل در خانواده ایمنی Mistral
Moderation 2 جایگزین مستقیم Mistral Moderation 2024 است. Context از ۸K به ۱۲۸K رسیده و سه Class تازه—Dangerous، Criminal و Jailbreaking—به Taxonomy اضافه شدهاند. این ارتقا برای Agent و مکالمه طولانی مهم است، زیرا حمله ممکن است طی چند Turn شکل بگیرد.
Moderation 2 یک سرویس مدیریتشدهٔ متنی با Taxonomy ثابت و امتیازهای خام است. اگر محصول شما تصویر هم دریافت میکند، یک سرویس مدیریتشدهٔ جداگانه برای بررسی تصویر و هماهنگی تصمیمها لازم خواهد بود.
در بازار گستردهتر، Moderation 2 با APIهای Moderation شرکتهای دیگر، Prompt Guardهای تخصصی Jailbreak و Classifier سفارشی رقابت میکند. تفاوت اصلی در Coverage Category، زبان، Context، قابلیت کالیبراسیون، Latency، Residency و نحوه ادغام با مدل مولد است.
قابلیتهای اصلی Mistral Moderation 2
طبقهبندی ۱۱ گروه ریسک
Taxonomy رسمی نسخه 26.03 شامل این موارد است:

| Category | مفهوم عملی |
|---|---|
| Sexual | محتوای جنسی صریح، برهنگی یا خدمات جنسی؛ با استثنای معمول محتوای آموزشی/پزشکی غیرصریح |
| Hate and Discrimination | نفرت، تبعیض، توهین و آزار براساس ویژگی محافظتشده |
| Violence and Threats | تهدید، تحریک، تجلیل یا شرح خشونت فیزیکی |
| Dangerous | رفتار بسیار خطرناک با ریسک جدی آسیب جسمی |
| Criminal | توصیف یا ترویج فعالیت غیرقانونی |
| Self-Harm | ترویج، برنامهریزی یا دستور خودآسیبی، خودکشی و اختلالات خودتخریبی |
| Health | مشاوره پزشکی تفصیلی یا شخصیسازیشده و تلاش برای دریافت آن |
| Financial | مشاوره مالی تفصیلی یا شخصیسازیشده و تلاش برای دریافت آن |
| Law | مشاوره حقوقی تفصیلی یا شخصیسازیشده و تلاش برای دریافت آن |
| PII | درخواست، انتشار یا تلاش برای بهدست آوردن اطلاعات هویتی شخصی |
| Jailbreaking | تلاش برای دور زدن Policy و رفتار ایمن با Manipulation یا Role-play |
Categoryهای Health، Financial و Law الزاماً «محتوای بد» به معنای عمومی نیستند؛ آنها Signal میدهند که محصول ممکن است به Disclaimer، محدودیت شخصیسازی یا متخصص نیاز داشته باشد. Action درست به Domain شما وابسته است.
Raw score و تصمیم Threshold
خروجی برای هر Category میتواند Score و Boolean نقض Policy داشته باشد. Threshold پیشفرض براساس Test set داخلی Mistral انتخاب شده، اما API اجازه میدهد Raw score را بگیرید و Threshold را برای محصول خود تنظیم کنید.
Score را Probability قطعی تلقی نکنید. اگر Threshold Self-harm را پایین بیاورید، Recall احتمالاً بهتر و False positive بیشتر میشود. در Category حساس، Curve Precision/Recall و هزینه خطا باید مبنای انتخاب باشد.
متن خام و Batch کوچک
Endpoint Raw text یک String یا فهرستی از Stringها را برای Batch کوچک میپذیرد. برای صف بزرگ، قابلیت Batch API رسمی نیز در صفحه مدل وجود دارد. Batch کوچک داخل درخواست با Job پردازش Batch یکسان نیست و Limitها باید در مستندات API کنترل شوند.
Moderation مکالمه چندمرحلهای
Endpoint مکالمه History را با Roleهای Conversation میبیند. این قابلیت برای تشخیص معنایی مفید است که در یک پیام بیخطر به نظر میرسد اما در بستر Turnهای قبلی به تهدید، PII یا دور زدن Policy تبدیل میشود.
Context ۱۲۸K ظرفیت زیادی دارد، ولی History نامرتبط میتواند Latency و False positive را افزایش دهد. Product باید Retention، خلاصهسازی و پنجره مرتبط را براساس Policy طراحی کند.
تشخیص Jailbreak
Category jailbreaking تلاشهایی مانند نادیده گرفتن System instruction، Role-play برای دور زدن محدودیت یا Manipulation مستقیم را هدف میگیرد. این Signal برای ورودی Agent مهم است؛ زیرا یک Prompt injection میتواند مدل را به استفاده نامناسب از Tool سوق دهد.
Jailbreak detection دفاع کامل نیست. Attack میتواند مبهم، چندزبانه، داخل سند یا غیرمستقیم باشد. Permission ابزار، Isolation داده، Egress policy و تأیید عمل حساس باید مستقل از Classifier باقی بمانند.
Inline Guardrail در Chat Completions
در درخواست POST /v1/chat/completions میتوان آرایه guardrails اضافه کرد. Guardrail پیش از رسیدن Prompt به مدل اصلی اجرا میشود. در صورت نقض، سرویس پاسخ 403 و جزئیات Category میدهد؛ در حالت Pass، نتیجه Guardrail همراه پاسخ بازمیگردد.
این مکانیزم طبق مستندات Input moderation است. اگر خروجی مدل نیز باید بررسی شود، Pipeline مستقل Moderation را پس از Generation فراخوانی کند. فرض اینکه Guardrail ورودی، خروجی را هم پوشش میدهد یک خطای معماری مهم است.
Guardrail برای Conversation و Agent
Guardrail را میتوان در درخواست Conversation یا هنگام ساخت Agent ثبت کرد تا مکالمههای آن Agent Policy پایه را به ارث ببرند. درخواست Conversation میتواند Guardrail را Override کند؛ کنترل دسترسی باید مانع شود کاربر غیرمجاز Threshold را بالا ببرد یا Category را غیرفعال کند.
Threshold سفارشی و Fail-closed
custom_category_thresholds برای هر Category عدد صفر تا یک میگیرد. مقدار ۱ طبق مستندات میتواند آن Category را عملاً غیرفعال کند. ignore_other_categories تعیین میکند فقط Categoryهای مشخصشده ارزیابی شوند یا بقیه هم فعال بمانند.
با block_on_error=true، خرابی سرویس Moderation نیز درخواست را Block میکند. این Fail-closed برای عمل حساس امنتر است، اما Availability را کم میکند. برای Chat کمریسک ممکن است Queue یا پاسخ محدود جایگزین بهتری باشد.
چندزبانه و Context بلند
Mistral عملکرد قوی روی داده چندزبانه پیچیده و مکالمات طولانی را ادعا میکند. بااینحال جدول زبانها یا امتیاز تفکیکی عمومی برای نسخه 26.03 منتشر نشده است. فارسی باید با Slang، Finglish، املای شکسته، کدسوئیچ فارسی/انگلیسی و متن راستبهچپ جدا سنجیده شود.
قابلیتهایی که مدل ندارد
Moderation 2 متن تولید نمیکند، سؤال را پاسخ نمیدهد، Web Search، Tool Use، Vision، Audio، Video یا Image Generation ندارد. برای بررسی تصویر باید سرویس چندوجهی جداگانهای به آن متصل شود. مدل همچنین هویت فرد، صحت ادعا یا قانونی بودن واقعی رفتار را تعیین نمیکند؛ فقط Categoryهای Policy را Classify میکند.
مهمترین نقاط قوت
API رایگان در زمان بررسی
صفحه مدل و Price list رسمی، Moderation 2 را Free نشان میدهند. این موضوع حذف Pre-filter یا Post-filter بهدلیل هزینه Token را سختتر توجیه میکند. البته Rate limit، SLA و هزینه Latency/Integration همچنان وجود دارند.
Context ۱۲۸K برای مکالمه طولانی
نسل قبلی ۸K بود؛ افزایش به ۱۲۸K اجازه میدهد الگوهای چندمرحلهای و Context دورتر بررسی شوند. این مزیت برای Agent، پشتیبانی طولانی و Workspace سازمانی معنیدار است.
Jailbreak در Taxonomy اصلی
Jailbreak یک Category رسمی با Score و Threshold است، نه Regex حاشیهای. تیم میتواند نرخ حمله، False positive و Drift این Category را جدا Monitor کند.
Raw score و کنترل Product
بهجای فقط «Safe/Unsafe»، Raw score در اختیار Pipeline است. تیم میتواند Action چندسطحی بسازد: Allow، Warning، محدود کردن Tool، Human review یا Block.
ادغام مستقیم با Mistral Chat و Agent
Guardrail میتواند در همان درخواست Chat، Conversation یا Config Agent قرار گیرد. این مسیر Boilerplate را کم میکند و block_on_error رفتار خرابی را روشن میسازد.
محدودیتها و نقاط ضعف
نبود Benchmark عمومی عددی برای نسخه دقیق
Mistral عبارت «عملکرد قوی» را به کار میبرد، اما Precision، Recall، F1، AUROC، نرخ False positive یا جدول رقیب برای mistral-moderation-2603 در منابع رسمی عمومی ارائه نشده است. بدون این اعداد، رتبهبندی مطلق قابل دفاع نیست.

Text-only بودن
تصویر Meme، Screenshot، صوت و ویدیو خارج از Modalities این سرویساند. اگر محصول UGC چندوجهی دارد، Moderation 2 فقط متن Caption/Transcript را میبیند و ممکن است معنای خطرناک خود رسانه را از دست بدهد.
Taxonomy ثابت با Policy شما یکی نیست
Category «Criminal» یا «Dangerous» گسترده است. یک فروشگاه، بانک، مدرسه و بازی آنلاین Threshold و Exceptionهای متفاوت دارند. Model taxonomy باید به Policy عملی و Reason code داخلی Mapping شود.
False positive و False negative اجتنابناپذیرند
نقل قول خبری درباره خشونت، متن پزشکی آموزشی یا کاربر در بحران میتواند شبیه محتوای ممنوع دیده شود. در سوی دیگر، زبان رمزگذاریشده و Slang ممکن است شناسایی نشود. Block کور میتواند به کاربر آسیبپذیر پاسخ نامناسب بدهد.
Threshold ممکن است با تغییر مدل Drift کند
مستندات Mistral هشدار میدهند مدل زیر Endpoint در طول زمان بهبود مییابد و Pipeline وابسته به category_scores ممکن است نیازمند Recalibration باشد. برای ثبات باید Version pin، Shadow test و Alert توزیع Score داشته باشید.
Input Guardrail خروجی را پوشش نمیدهد
Guardrail Inline پیش از مدل اجرا میشود. اگر مدل اصلی پاسخ خطرناک بسازد، Post-moderation جدا لازم است. Tool argument و نتیجه Tool نیز نقاط کنترل مستقلاند.
رایگان بودن تضمین همیشگی یا SLA نیست
قیمت فعلی صفر است، اما Rate limit، Availability و Price میتوانند تغییر کنند. محصول Production باید Fallback و رفتار هنگام خطا داشته باشد و صفحه رسمی را دورهای کنترل کند.
کاربردهای واقعی Mistral Moderation 2
Chatbot پشتیبانی با ورودی و خروجی دوطرفه
پیام کاربر پیش از مدل Classify میشود؛ پاسخ Draft نیز پیش از نمایش دوباره بررسی میشود. Category Health یا Financial میتواند به Template محدود و ارجاع به کارشناس منجر شود، بدون اینکه همه گفتگو Block شود.
Agent با Toolهای حساس
درخواست Jailbreak یا Criminal میتواند دسترسی Webhook، Email یا Database write را غیرفعال کند، در حالی که Agent فقط پاسخ ایمن متنی میدهد. Permission واقعی در Backend اعمال میشود و مدل نمیتواند آن را Override کند.
جلوگیری از نشت PII
پیام ورودی و پاسخ خروجی برای PII Score بررسی میشوند. برای دقت بهتر، Classifier با Regex، DLP و Named Entity Recognition ترکیب میشود؛ زیرا شماره کارت، شناسه محلی و متن Obfuscated ممکن است به Rule قطعی نیاز داشته باشند.
انجمن و محتوای تولیدشده توسط کاربر
پست تازه ابتدا دستهبندی میشود. محتوای واضح Block، مورد مرزی در Queue بازبینی و محتوای کمریسک منتشر میشود. Appeal و Audit log برای اصلاح False positive ضروریاند.
مکالمه بحران و Self-harm
Score Self-harm میتواند مسیر پاسخ حمایتی و ارجاع به منابع بحران را فعال کند. سیستم نباید کاربر را با پیام سرد «نقض Policy» رها کند. در خطر فوری، پروتکل انسانی و قوانین محل ارائه سرویس مهماند.
بررسی Long conversation برای Attack تدریجی
History مکالمه به Endpoint گفتگویی داده میشود تا Jailbreak چندمرحلهای بهتر دیده شود. برای کاهش هزینه و حریم خصوصی، فقط Turnهای مرتبط و Metadata حداقلی نگه داشته میشوند.
Analytics ایمنی بدون ذخیره متن کامل
تیم میتواند Count و توزیع Category/Score را با شناسه ناشناس نگه دارد، نه متن حساس کامل. Retention، Encryption و دسترسی Analyst باید براساس مقررات و Privacy policy تنظیم شوند.
این مدل مناسب چه کسانی است؟
- سازندگان Chatbot، Agent و Copilot مبتنی بر Mistral؛
- پلتفرمهای UGC متنمحور؛
- تیمهای Trust & Safety و امنیت AI؛
- محصولات مالی، حقوقی و سلامت که Risk routing میخواهند؛
- توسعهدهندگان نیازمند Raw score و Threshold سفارشی؛
- کسبوکارهایی که Context مکالمه طولانی را Moderation میکنند.
برای رسانه چندوجهی، سرویس Vision moderation لازم است. برای Policy بسیار خاص نیز Classifier سفارشی، Rule engine و Human review باید کنار مدل باشند.
مشخصات فنی
| مشخصه | مقدار تأییدشده |
|---|---|
| Developer | Mistral AI |
| Model family | Mistral Moderation |
| Version / release | v26.03؛ صفحه رسمی ۱ مارس ۲۰۲۶ |
| Status | GA؛ Premier؛ Active |
| Model type | Text safety classifier |
| API ID | mistral-moderation-2603 |
| Input | متن خام، فهرست متن و محتوای مکالمه |
| Output | Category score، Flag/violation و تصمیم Guardrail |
| Categories | ۱۱ Category رسمی |
| Context Window | ۱۲۸K توکن |
| Maximum Output | کاربرد ندارد؛ مدل Generative نیست |
| Jailbreak detection | بله |
| Multilingual | ادعای رسمی بله؛ جدول امتیاز زبان عمومی نیست |
| Vision / Audio / Video | خیر / تأیید نشده برای این Endpoint متنی |
| Web Search / Tool Use | خیر |
| API routes | /v1/moderations، Batch و Guardrail در Chat/Conversation/Agent |
| API price | رایگان در تاریخ بررسی |
| Open weights | خیر؛ وزن عمومی تأیید نشده |
| Predecessor | mistral-moderation-2411؛ Deprecated از ۳۱ مارس ۲۰۲۶ |
۵ نمونه Prompt و Policy کاربردی
چون مدل Classifier است، این نمونهها بیشتر به شکل ورودی آزمون و دستور Pipeline نوشته شدهاند، نه Prompt تولید محتوا.
۱. Moderation دوطرفه Chat
متن ورودی کاربر را با هر ۱۱ Category بررسی کن و Raw score را ذخیره کن. پیش از نمایش پاسخ مدل نیز همان بررسی را تکرار کن. ورودی و خروجی را در Log جدا نگه دار و Action را از جدول Policy داخلی انتخاب کن؛ مدل Moderation نباید خودش متن جایگزین تولید کند.
۲. Jailbreak در مکالمه بلند
تمام Turnهای مرتبط با درخواست فعلی را بهترتیب Role بررسی کن. اگر Jailbreak score از Threshold نسخهشده بالاتر بود، Toolها را غیرفعال و درخواست را به پاسخ محدود هدایت کن. صرف وجود عبارت آموزشی درباره Prompt injection را بدون Context حمله قطعی ندان.
۳. PII با لایه DLP
Category PII را ارزیابی کن و نتیجه را با Regex شماره کارت، ایمیل و شناسههای محلی ترکیب کن. اگر هر Rule قطعی فعال شد، مقدار حساس را Redact کن؛ اگر فقط Score مدل مرزی بود، مورد را برای بازبینی انسانی Queue کن.
۴. Routing حوزه سلامت
اگر Health یا Self-harm فعال شد، پیام را حذف خودکار نکن. Intent را به مسیر مناسب بفرست: اطلاعات عمومی، هشدار عدم جایگزینی پزشک، پاسخ حمایتی بحران یا ارجاع فوری. متن اصلی فقط با دسترسی محدود و Retention کوتاه نگهداری شود.
۵. Eval فارسی چندسبکی
این مجموعه را به تفکیک فارسی رسمی، محاوره، Finglish، غلط املایی، Emoji و کدسوئیچ فارسی/انگلیسی ارزیابی کن. برای هر Category، Precision، Recall، F1 و False-positive rate را گزارش و Threshold انتخابی را با نسخه مدل ثبت کن.
بنچمارک و مقایسه عملکرد
چه داده عمومی برای نسخه 26.03 وجود دارد؟
| مورد | نتیجه قابل تأیید | تاریخ/منبع |
|---|---|---|
| Precision / Recall / F1 کل | منتشر نشده | صفحه رسمی مدل، بررسی ۱۳ سپتامبر ۲۰۲۶ |
| امتیاز تفکیکی ۱۱ Category | منتشر نشده | مستندات Moderation |
| Jailbreak detection rate | منتشر نشده | صفحه رسمی فقط وجود قابلیت را تأیید میکند |
| Benchmark چندزبانه | عدد عمومی منتشر نشده | ادعای کیفی Mistral |
| مقایسه عددی با رقیب | منتشر نشده | جدول رسمی همشرط پیدا نشد |
Mistral برای نسخه دقیق عبارت «Strong performance» را به کار میبرد، اما عدد و Protocol عمومی ارائه نمیکند. بنابراین درج امتیاز ساختگی یا استفاده از Benchmark نسل 2024 به نام Moderation 2 غلط است. این نبود شفافیت، خود یک محدودیت قابلذکر در خرید سازمانی است.
مقایسه قابلتأیید با نسل قبلی؛ مشخصات، نه Benchmark
| ویژگی | Mistral Moderation 2 | Mistral Moderation 2024 |
|---|---|---|
| Context | ۱۲۸K | ۸K |
| تعداد Category | ۱۱ | ۸ |
| Dangerous | بله | در Taxonomy قدیمی نبود |
| Criminal | بله | در Taxonomy قدیمی نبود |
| Jailbreaking | بله | در Taxonomy قدیمی نبود |
| وضعیت | GA و Active | Deprecated از ۳۱ مارس ۲۰۲۶ |
این جدول از صفحه نسخه فعلی، راهنمای Moderation و صفحه نسخه قدیمی ساخته شده است. افزایش Context و Category پیشرفت محصول است، اما اثبات نمیکند Accuracy همه Classها بالاتر رفته است.
Benchmark منصفانه باید چه چیزی را بسنجد؟
| معیار | کاربرد |
|---|---|
| Macro/Weighted F1 | تعادل کیفیت میان Classهای کمتعداد و پرتعداد |
| Recall هر Category | چند مورد واقعاً خطرناک کشف میشود؟ |
| False-positive rate | چند پیام سالم بیدلیل Block میشود؟ |
| PR-AUC | کیفیت تفکیک در داده نامتوازن |
| Calibration error | آیا Score با احتمال واقعی خطا همخوان است؟ |
| Jailbreak TPR در FPR ثابت | تشخیص حمله بدون مسدود کردن بیرویه |
| Breakdown زبان و Dialect | آیا کیفیت فارسی و کدسوئیچ افت میکند؟ |
| p95 Latency و Availability | آیا Guardrail گلوگاه Production است؟ |
| Drift در نسخه و زمان | آیا Threshold پس از Update معتبر میماند؟ |
Dataset باید شامل مثال سالم نزدیک به مرز باشد: مقاله خبری خشونت، آموزش پزشکی، بحث حقوقی عمومی، نقل قول نفرت برای نقد و پیام بحران. فقط نمونههای واضح باعث Benchmark خوشبینانه و Threshold بد میشوند.
تحلیل برای کاربرد واقعی
نقطه قوت قابل اثبات Moderation 2، Coverage محصول است: ۱۱ Category، Context بلند، Raw score و Integration Inline. نقطه ضعف شواهد، نبود نرخ خطای عمومی است. برای همین نمیتوان گفت در فارسی یا Jailbreak از همه رقبا بهتر است.
اگر تیم شما Mistral Chat/Agent استفاده میکند، Integration و قیمت رایگان مزیت عملی بزرگی دارند. اگر تصویر را Moderation میکنید، باید سرویس جداگانهٔ پشتیبان تصویر را ارزیابی کنید. اگر Policy شرکت بسیار اختصاصی است، Classifier سفارشی یا Rule engine میتواند در کنار Moderation 2 بهتر از یک Threshold عمومی عمل کند.
مقایسه با رقبا و جایگزینهای مستقیم
| گزینه | نوع ورودی و تمرکز | مزیت | چه زمانی انتخاب بهتری است؟ |
|---|---|---|---|
| Mistral Moderation 2 | متن و مکالمه؛ ۱۱ Category ثابت | ۱۲۸K، Jailbreak، Raw score، API رایگان | Chat/Agent متنی و Integration سریع Mistral |
| Classifier سفارشی Mistral | Category و داده اختصاصی سازمان | انطباق با Policy محلی | Fraud، Compliance یا Taxonomy ویژه کسبوکار |
سرویسهای مدیریتشده و Classifier سفارشی Benchmark هممعنا ندارند. Moderation 2 Taxonomy آماده و API مدیریتشده دارد؛ برای Policy محلی، تیم میتواند Rule engine و بازبینی انسانی را در کنار آن قرار دهد.
قیمت و API
براساس صفحه رسمی قیمت Mistral و مدل Moderation 2، در ۱۳ سپتامبر ۲۰۲۶ استفاده API این Classifier رایگان است.
قیمت صفر به معنای هزینه عملیاتی صفر نیست. هر فراخوانی Latency دارد، ممکن است Rate limit داشته باشد و به Logging، Monitoring، Human review و Fallback نیاز دارد. Mistral SLA یا ظرفیت نامحدود را صرفاً با واژه Free تضمین نمیکند.
برای کنترل نسخه از mistral-moderation-2603 استفاده کنید. اگر Alias یا مدل زیر سرویس در آینده تغییر کند، توزیع Score و Threshold را با Shadow traffic دوباره Calibrate کنید. Mistral بهطور مشخص درباره نیاز احتمالی Recalibration هشدار داده است.
شروع استفاده از Mistral Moderation 2 در Buffalo147 AI
بهترین شروع، آزمایش چند پیام واضح و چند پیام مرزی از محصول واقعی شماست. فقط Flag نهایی را نگاه نکنید؛ Score هر Category، دلیل Policy و رفتار Threshold را مقایسه کنید. سپس تصمیم Allow/Review/Block را در Backend تعریف کنید، نه داخل Prompt کاربر.
شروع استفاده از Mistral Moderation 2 در Buffalo147 AI
جمعبندی؛ لایه ایمنی آماده، اما نه پاسخ کامل Trust & Safety
مهمترین مزیت Mistral Moderation 2 ترکیب API رایگان، Context ۱۲۸K، ۱۱ Category، Jailbreak detection و Raw score است. برای تیمی که روی Mistral Chat یا Agent محصول میسازد، Guardrail Inline مسیر Integration کوتاهی دارد.
محدودیت اصلی، نبود Benchmark عمومی دقیق است. بدون Precision، Recall و Breakdown زبان نمیتوان از روی صفحه محصول Threshold Production انتخاب کرد. Text-only بودن و پوشش ندادن خودکار خروجی نیز باید در معماری جبران شوند.
این مدل برای Pre/Post moderation، PII routing، کنترل Agent و مکالمه طولانی انتخاب خوبی است—بهشرطی که با Policy روشن، Eval فارسی، Version pin، Rule قطعی و Human review ترکیب شود. یک Classifier میتواند هشدار بدهد؛ مسئولیت تصمیم و تجربه کاربر همچنان با سازنده محصول است.
سؤالات متداول
Mistral Moderation 2 چیست؟
یک Classifier ایمنی متنی از Mistral AI است که متن و مکالمه را در ۱۱ Category بررسی و Score/Flag برمیگرداند. مدل پاسخ تولید نمیکند.
آیا Mistral Moderation 2 رایگان است؟
بله، در آخرین بررسی ۱۳ سپتامبر ۲۰۲۶ صفحه رسمی مدل و قیمت آن را Free نشان میدادند. Rate limit و شرایط سرویس باید جدا بررسی شوند.
آیا Jailbreak را تشخیص میدهد؟
بله، jailbreaking یکی از Categoryهای رسمی نسخه 26.03 است. بااینحال این قابلیت جای Permission و Sandbox ابزار را نمیگیرد.
Context Window چقدر است؟
Context رسمی ۱۲۸K توکن است؛ برای مکالمه چندمرحلهای بلند مناسبتر از نسل ۸K قبلی است.
آیا تصویر را Moderation میکند؟
خیر، Moderation 2 سرویس Text classification است. برای متن و تصویر باید سرویس چندوجهی مرتبط را جداگانه ارزیابی کرد.
آیا خروجی مدل اصلی هم خودکار بررسی میشود؟
Guardrail Inline مستندشده روی ورودی اجرا میشود. برای خروجی باید Post-moderation مستقل در Pipeline اضافه شود.
چه Categoryهایی دارد؟
Sexual، Hate/Discrimination، Violence/Threats، Dangerous، Criminal، Self-harm، Health، Financial، Law، PII و Jailbreaking.
آیا Threshold قابل تغییر است؟
بله. API Raw score میدهد و Custom Guardrails Threshold هر Category را میپذیرد. Threshold باید با Dataset واقعی و هزینه False positive/negative تنظیم شود.
آیا برای فارسی مناسب است؟
Mistral عملکرد چندزبانه را ادعا میکند، اما امتیاز فارسی عمومی منتشر نشده است. Eval شامل محاوره، Finglish، کدسوئیچ و املای شکسته ضروری است.
چه زمانی Classifier سفارشی هم لازم است؟
وقتی دستهبندیهای استاندارد برای Policy اختصاصی سازمان کافی نیستند، داده و برچسبهای خود را برای سنجش Classifier سفارشی آماده کنید و نتیجه را کنار API مدیریتشده ارزیابی کنید.
منابع و روش راستیآزمایی
- صفحه رسمی Mistral Moderation 2
- راهنمای رسمی Moderation، Categoryها و Guardrails
- صفحه رسمی نسل قبلی و وضعیت Deprecation
- فهرست رسمی مدلهای Mistral
- قیمت رسمی Mistral API
- وضعیت Lifecycle در Mistral Legal Center
این مقاله برای Buffalo147 AI از صفر نوشته شده است. چون برای نسخه دقیق 26.03 امتیاز عمومی قابلبررسی منتشر نشده، هیچ عدد Benchmark یا برتری رقابتی حدس زده نشده و نبود داده بهصورت شفاف گزارش شده است.