Buffalo147 AI

خانه › بلاگ

Mistral Moderation 2؛ بررسی فیلتر ایمنی رایگان با تشخیص Jailbreak و Context بلند

تصویر شاخص Mistral Moderation 2 با نام درشت مدل و سپر طبقه‌بندی که حمله Jailbreak را در جریان مکالمه مسدود می‌کند

آخرین راستی‌آزمایی: ۱۳ سپتامبر ۲۰۲۶

در یک نگاه | Mistral Moderation 2
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: براساس صفحه رسمی قیمت Mistral و مدل Moderation 2، در ۱۳ سپتامبر ۲۰۲۶ استفاده API این Classifier رایگان است. تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه؛ فیلتر محتوا یک دکمه روشن و خاموش نیست

وقتی یک Chatbot یا Agent عمومی می‌شود، سؤال فقط این نیست که مدل پاسخ خوبی می‌دهد یا نه. ورودی می‌تواند حاوی تهدید، اطلاعات شخصی، درخواست خودآسیبی یا تلاش برای دور زدن دستورهای ایمنی باشد؛ خروجی نیز ممکن است بدون کنترل به کاربر برسد. اینجا یک مدل Moderation نقش لایه تشخیص را دارد.

Mistral Moderation 2 نسل دوم سرویس تعدیل محتوای Mistral AI است. این مدل متن خام یا مکالمه چندمرحله‌ای را در ۱۱ Category بررسی و برای هر Category Score و تصمیم نقض Policy برمی‌گرداند. Context رسمی ۱۲۸K به آن اجازه می‌دهد خطر را در History بلند ببیند، نه فقط در آخرین جمله.

قابلیت برجسته نسل دوم، تشخیص Jailbreak و اضافه شدن Categoryهای dangerous و criminal است. API در زمان بررسی رایگان است و می‌توان آن را مستقل فراخوانی کرد یا به‌صورت Inline guardrail جلوی Chat Completions، Conversation و Agent قرار داد. بااین‌حال هیچ Classifier ایمنی به‌تنهایی Policy، نیروی انسانی و Monitoring را جایگزین نمی‌کند.

Mistral Moderation 2 چیست؟

Mistral Moderation 2 یک مدل تخصصی Text classification است، نه مدل تولید متن. ورودی را می‌خواند و احتمال/Score چند نوع ریسک را برمی‌گرداند. Endpoint نسخه‌ای mistral-moderation-2603 در صفحه رسمی با وضعیت GA و طبقه Premier ثبت شده است.

تاریخ صفحه مدل ۱ مارس ۲۰۲۶ است و Mistral معرفی عمومی را در ۱۷ مارس منتشر کرد. نسل قبلی با شناسه mistral-moderation-2411 در ۳۱ مارس ۲۰۲۶ Deprecated شد و مستندات، Moderation 2 را جایگزین Integration جدید معرفی می‌کنند.

این سرویس دو روش استفاده اصلی دارد:

  • Moderation API مستقل: برای دریافت Raw score و کنترل Threshold در Pipeline خودتان؛
  • Custom Guardrails: برای تعریف Category و Threshold داخل درخواست Chat/Conversation/Agent و Block خودکار پیش از رسیدن ورودی به مدل اصلی.

در هر دو حالت، Policy محصول باید مشخص کند با هر نتیجه چه اتفاقی می‌افتد: Allow، Warn، Age gate، Redact، محدود کردن Tool یا ارجاع به انسان. مدل صرفاً Signal می‌دهد.

جایگاه مدل در خانواده ایمنی Mistral

Moderation 2 جایگزین مستقیم Mistral Moderation 2024 است. Context از ۸K به ۱۲۸K رسیده و سه Class تازه—Dangerous، Criminal و Jailbreaking—به Taxonomy اضافه شده‌اند. این ارتقا برای Agent و مکالمه طولانی مهم است، زیرا حمله ممکن است طی چند Turn شکل بگیرد.

Moderation 2 یک سرویس مدیریت‌شدهٔ متنی با Taxonomy ثابت و امتیازهای خام است. اگر محصول شما تصویر هم دریافت می‌کند، یک سرویس مدیریت‌شدهٔ جداگانه برای بررسی تصویر و هماهنگی تصمیم‌ها لازم خواهد بود.

در بازار گسترده‌تر، Moderation 2 با APIهای Moderation شرکت‌های دیگر، Prompt Guardهای تخصصی Jailbreak و Classifier سفارشی رقابت می‌کند. تفاوت اصلی در Coverage Category، زبان، Context، قابلیت کالیبراسیون، Latency، Residency و نحوه ادغام با مدل مولد است.

قابلیت‌های اصلی Mistral Moderation 2

طبقه‌بندی ۱۱ گروه ریسک

Taxonomy رسمی نسخه 26.03 شامل این موارد است:

شماتیک روند ورودی، مدل و خروجی برای Mistral Moderation 2
نمای شماتیک روند درخواست تا خروجی برای Mistral Moderation 2؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.
Category مفهوم عملی
Sexual محتوای جنسی صریح، برهنگی یا خدمات جنسی؛ با استثنای معمول محتوای آموزشی/پزشکی غیرصریح
Hate and Discrimination نفرت، تبعیض، توهین و آزار براساس ویژگی محافظت‌شده
Violence and Threats تهدید، تحریک، تجلیل یا شرح خشونت فیزیکی
Dangerous رفتار بسیار خطرناک با ریسک جدی آسیب جسمی
Criminal توصیف یا ترویج فعالیت غیرقانونی
Self-Harm ترویج، برنامه‌ریزی یا دستور خودآسیبی، خودکشی و اختلالات خودتخریبی
Health مشاوره پزشکی تفصیلی یا شخصی‌سازی‌شده و تلاش برای دریافت آن
Financial مشاوره مالی تفصیلی یا شخصی‌سازی‌شده و تلاش برای دریافت آن
Law مشاوره حقوقی تفصیلی یا شخصی‌سازی‌شده و تلاش برای دریافت آن
PII درخواست، انتشار یا تلاش برای به‌دست آوردن اطلاعات هویتی شخصی
Jailbreaking تلاش برای دور زدن Policy و رفتار ایمن با Manipulation یا Role-play

Categoryهای Health، Financial و Law الزاماً «محتوای بد» به معنای عمومی نیستند؛ آن‌ها Signal می‌دهند که محصول ممکن است به Disclaimer، محدودیت شخصی‌سازی یا متخصص نیاز داشته باشد. Action درست به Domain شما وابسته است.

Raw score و تصمیم Threshold

خروجی برای هر Category می‌تواند Score و Boolean نقض Policy داشته باشد. Threshold پیش‌فرض براساس Test set داخلی Mistral انتخاب شده، اما API اجازه می‌دهد Raw score را بگیرید و Threshold را برای محصول خود تنظیم کنید.

Score را Probability قطعی تلقی نکنید. اگر Threshold Self-harm را پایین بیاورید، Recall احتمالاً بهتر و False positive بیشتر می‌شود. در Category حساس، Curve Precision/Recall و هزینه خطا باید مبنای انتخاب باشد.

متن خام و Batch کوچک

Endpoint Raw text یک String یا فهرستی از Stringها را برای Batch کوچک می‌پذیرد. برای صف بزرگ، قابلیت Batch API رسمی نیز در صفحه مدل وجود دارد. Batch کوچک داخل درخواست با Job پردازش Batch یکسان نیست و Limitها باید در مستندات API کنترل شوند.

Moderation مکالمه چندمرحله‌ای

Endpoint مکالمه History را با Roleهای Conversation می‌بیند. این قابلیت برای تشخیص معنایی مفید است که در یک پیام بی‌خطر به نظر می‌رسد اما در بستر Turnهای قبلی به تهدید، PII یا دور زدن Policy تبدیل می‌شود.

Context ۱۲۸K ظرفیت زیادی دارد، ولی History نامرتبط می‌تواند Latency و False positive را افزایش دهد. Product باید Retention، خلاصه‌سازی و پنجره مرتبط را براساس Policy طراحی کند.

تشخیص Jailbreak

Category jailbreaking تلاش‌هایی مانند نادیده گرفتن System instruction، Role-play برای دور زدن محدودیت یا Manipulation مستقیم را هدف می‌گیرد. این Signal برای ورودی Agent مهم است؛ زیرا یک Prompt injection می‌تواند مدل را به استفاده نامناسب از Tool سوق دهد.

Jailbreak detection دفاع کامل نیست. Attack می‌تواند مبهم، چندزبانه، داخل سند یا غیرمستقیم باشد. Permission ابزار، Isolation داده، Egress policy و تأیید عمل حساس باید مستقل از Classifier باقی بمانند.

Inline Guardrail در Chat Completions

در درخواست POST /v1/chat/completions می‌توان آرایه guardrails اضافه کرد. Guardrail پیش از رسیدن Prompt به مدل اصلی اجرا می‌شود. در صورت نقض، سرویس پاسخ 403 و جزئیات Category می‌دهد؛ در حالت Pass، نتیجه Guardrail همراه پاسخ بازمی‌گردد.

این مکانیزم طبق مستندات Input moderation است. اگر خروجی مدل نیز باید بررسی شود، Pipeline مستقل Moderation را پس از Generation فراخوانی کند. فرض اینکه Guardrail ورودی، خروجی را هم پوشش می‌دهد یک خطای معماری مهم است.

Guardrail برای Conversation و Agent

Guardrail را می‌توان در درخواست Conversation یا هنگام ساخت Agent ثبت کرد تا مکالمه‌های آن Agent Policy پایه را به ارث ببرند. درخواست Conversation می‌تواند Guardrail را Override کند؛ کنترل دسترسی باید مانع شود کاربر غیرمجاز Threshold را بالا ببرد یا Category را غیرفعال کند.

Threshold سفارشی و Fail-closed

custom_category_thresholds برای هر Category عدد صفر تا یک می‌گیرد. مقدار ۱ طبق مستندات می‌تواند آن Category را عملاً غیرفعال کند. ignore_other_categories تعیین می‌کند فقط Categoryهای مشخص‌شده ارزیابی شوند یا بقیه هم فعال بمانند.

با block_on_error=true، خرابی سرویس Moderation نیز درخواست را Block می‌کند. این Fail-closed برای عمل حساس امن‌تر است، اما Availability را کم می‌کند. برای Chat کم‌ریسک ممکن است Queue یا پاسخ محدود جایگزین بهتری باشد.

چندزبانه و Context بلند

Mistral عملکرد قوی روی داده چندزبانه پیچیده و مکالمات طولانی را ادعا می‌کند. بااین‌حال جدول زبان‌ها یا امتیاز تفکیکی عمومی برای نسخه 26.03 منتشر نشده است. فارسی باید با Slang، Finglish، املای شکسته، کدسوئیچ فارسی/انگلیسی و متن راست‌به‌چپ جدا سنجیده شود.

قابلیت‌هایی که مدل ندارد

Moderation 2 متن تولید نمی‌کند، سؤال را پاسخ نمی‌دهد، Web Search، Tool Use، Vision، Audio، Video یا Image Generation ندارد. برای بررسی تصویر باید سرویس چندوجهی جداگانه‌ای به آن متصل شود. مدل همچنین هویت فرد، صحت ادعا یا قانونی بودن واقعی رفتار را تعیین نمی‌کند؛ فقط Categoryهای Policy را Classify می‌کند.

مهم‌ترین نقاط قوت

API رایگان در زمان بررسی

صفحه مدل و Price list رسمی، Moderation 2 را Free نشان می‌دهند. این موضوع حذف Pre-filter یا Post-filter به‌دلیل هزینه Token را سخت‌تر توجیه می‌کند. البته Rate limit، SLA و هزینه Latency/Integration همچنان وجود دارند.

Context ۱۲۸K برای مکالمه طولانی

نسل قبلی ۸K بود؛ افزایش به ۱۲۸K اجازه می‌دهد الگوهای چندمرحله‌ای و Context دورتر بررسی شوند. این مزیت برای Agent، پشتیبانی طولانی و Workspace سازمانی معنی‌دار است.

Jailbreak در Taxonomy اصلی

Jailbreak یک Category رسمی با Score و Threshold است، نه Regex حاشیه‌ای. تیم می‌تواند نرخ حمله، False positive و Drift این Category را جدا Monitor کند.

Raw score و کنترل Product

به‌جای فقط «Safe/Unsafe»، Raw score در اختیار Pipeline است. تیم می‌تواند Action چندسطحی بسازد: Allow، Warning، محدود کردن Tool، Human review یا Block.

ادغام مستقیم با Mistral Chat و Agent

Guardrail می‌تواند در همان درخواست Chat، Conversation یا Config Agent قرار گیرد. این مسیر Boilerplate را کم می‌کند و block_on_error رفتار خرابی را روشن می‌سازد.

محدودیت‌ها و نقاط ضعف

نبود Benchmark عمومی عددی برای نسخه دقیق

Mistral عبارت «عملکرد قوی» را به کار می‌برد، اما Precision، Recall، F1، AUROC، نرخ False positive یا جدول رقیب برای mistral-moderation-2603 در منابع رسمی عمومی ارائه نشده است. بدون این اعداد، رتبه‌بندی مطلق قابل دفاع نیست.

سه معیار ارزیابی عملی برای Mistral Moderation 2
معیارهای پیشنهادی برای آزمون Mistral Moderation 2 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

Text-only بودن

تصویر Meme، Screenshot، صوت و ویدیو خارج از Modalities این سرویس‌اند. اگر محصول UGC چندوجهی دارد، Moderation 2 فقط متن Caption/Transcript را می‌بیند و ممکن است معنای خطرناک خود رسانه را از دست بدهد.

Taxonomy ثابت با Policy شما یکی نیست

Category «Criminal» یا «Dangerous» گسترده است. یک فروشگاه، بانک، مدرسه و بازی آنلاین Threshold و Exceptionهای متفاوت دارند. Model taxonomy باید به Policy عملی و Reason code داخلی Mapping شود.

False positive و False negative اجتناب‌ناپذیرند

نقل قول خبری درباره خشونت، متن پزشکی آموزشی یا کاربر در بحران می‌تواند شبیه محتوای ممنوع دیده شود. در سوی دیگر، زبان رمزگذاری‌شده و Slang ممکن است شناسایی نشود. Block کور می‌تواند به کاربر آسیب‌پذیر پاسخ نامناسب بدهد.

Threshold ممکن است با تغییر مدل Drift کند

مستندات Mistral هشدار می‌دهند مدل زیر Endpoint در طول زمان بهبود می‌یابد و Pipeline وابسته به category_scores ممکن است نیازمند Recalibration باشد. برای ثبات باید Version pin، Shadow test و Alert توزیع Score داشته باشید.

Input Guardrail خروجی را پوشش نمی‌دهد

Guardrail Inline پیش از مدل اجرا می‌شود. اگر مدل اصلی پاسخ خطرناک بسازد، Post-moderation جدا لازم است. Tool argument و نتیجه Tool نیز نقاط کنترل مستقل‌اند.

رایگان بودن تضمین همیشگی یا SLA نیست

قیمت فعلی صفر است، اما Rate limit، Availability و Price می‌توانند تغییر کنند. محصول Production باید Fallback و رفتار هنگام خطا داشته باشد و صفحه رسمی را دوره‌ای کنترل کند.

کاربردهای واقعی Mistral Moderation 2

Chatbot پشتیبانی با ورودی و خروجی دوطرفه

پیام کاربر پیش از مدل Classify می‌شود؛ پاسخ Draft نیز پیش از نمایش دوباره بررسی می‌شود. Category Health یا Financial می‌تواند به Template محدود و ارجاع به کارشناس منجر شود، بدون اینکه همه گفتگو Block شود.

Agent با Toolهای حساس

درخواست Jailbreak یا Criminal می‌تواند دسترسی Webhook، Email یا Database write را غیرفعال کند، در حالی که Agent فقط پاسخ ایمن متنی می‌دهد. Permission واقعی در Backend اعمال می‌شود و مدل نمی‌تواند آن را Override کند.

جلوگیری از نشت PII

پیام ورودی و پاسخ خروجی برای PII Score بررسی می‌شوند. برای دقت بهتر، Classifier با Regex، DLP و Named Entity Recognition ترکیب می‌شود؛ زیرا شماره کارت، شناسه محلی و متن Obfuscated ممکن است به Rule قطعی نیاز داشته باشند.

انجمن و محتوای تولیدشده توسط کاربر

پست تازه ابتدا دسته‌بندی می‌شود. محتوای واضح Block، مورد مرزی در Queue بازبینی و محتوای کم‌ریسک منتشر می‌شود. Appeal و Audit log برای اصلاح False positive ضروری‌اند.

مکالمه بحران و Self-harm

Score Self-harm می‌تواند مسیر پاسخ حمایتی و ارجاع به منابع بحران را فعال کند. سیستم نباید کاربر را با پیام سرد «نقض Policy» رها کند. در خطر فوری، پروتکل انسانی و قوانین محل ارائه سرویس مهم‌اند.

بررسی Long conversation برای Attack تدریجی

History مکالمه به Endpoint گفتگویی داده می‌شود تا Jailbreak چندمرحله‌ای بهتر دیده شود. برای کاهش هزینه و حریم خصوصی، فقط Turnهای مرتبط و Metadata حداقلی نگه داشته می‌شوند.

Analytics ایمنی بدون ذخیره متن کامل

تیم می‌تواند Count و توزیع Category/Score را با شناسه ناشناس نگه دارد، نه متن حساس کامل. Retention، Encryption و دسترسی Analyst باید براساس مقررات و Privacy policy تنظیم شوند.

این مدل مناسب چه کسانی است؟

  • سازندگان Chatbot، Agent و Copilot مبتنی بر Mistral؛
  • پلتفرم‌های UGC متن‌محور؛
  • تیم‌های Trust & Safety و امنیت AI؛
  • محصولات مالی، حقوقی و سلامت که Risk routing می‌خواهند؛
  • توسعه‌دهندگان نیازمند Raw score و Threshold سفارشی؛
  • کسب‌وکارهایی که Context مکالمه طولانی را Moderation می‌کنند.

برای رسانه چندوجهی، سرویس Vision moderation لازم است. برای Policy بسیار خاص نیز Classifier سفارشی، Rule engine و Human review باید کنار مدل باشند.

مشخصات فنی

مشخصه مقدار تأییدشده
Developer Mistral AI
Model family Mistral Moderation
Version / release v26.03؛ صفحه رسمی ۱ مارس ۲۰۲۶
Status GA؛ Premier؛ Active
Model type Text safety classifier
API ID mistral-moderation-2603
Input متن خام، فهرست متن و محتوای مکالمه
Output Category score، Flag/violation و تصمیم Guardrail
Categories ۱۱ Category رسمی
Context Window ۱۲۸K توکن
Maximum Output کاربرد ندارد؛ مدل Generative نیست
Jailbreak detection بله
Multilingual ادعای رسمی بله؛ جدول امتیاز زبان عمومی نیست
Vision / Audio / Video خیر / تأیید نشده برای این Endpoint متنی
Web Search / Tool Use خیر
API routes /v1/moderations، Batch و Guardrail در Chat/Conversation/Agent
API price رایگان در تاریخ بررسی
Open weights خیر؛ وزن عمومی تأیید نشده
Predecessor mistral-moderation-2411؛ Deprecated از ۳۱ مارس ۲۰۲۶

۵ نمونه Prompt و Policy کاربردی

چون مدل Classifier است، این نمونه‌ها بیشتر به شکل ورودی آزمون و دستور Pipeline نوشته شده‌اند، نه Prompt تولید محتوا.

۱. Moderation دوطرفه Chat

متن ورودی کاربر را با هر ۱۱ Category بررسی کن و Raw score را ذخیره کن. پیش از نمایش پاسخ مدل نیز همان بررسی را تکرار کن. ورودی و خروجی را در Log جدا نگه دار و Action را از جدول Policy داخلی انتخاب کن؛ مدل Moderation نباید خودش متن جایگزین تولید کند.

۲. Jailbreak در مکالمه بلند

تمام Turnهای مرتبط با درخواست فعلی را به‌ترتیب Role بررسی کن. اگر Jailbreak score از Threshold نسخه‌شده بالاتر بود، Toolها را غیرفعال و درخواست را به پاسخ محدود هدایت کن. صرف وجود عبارت آموزشی درباره Prompt injection را بدون Context حمله قطعی ندان.

۳. PII با لایه DLP

Category PII را ارزیابی کن و نتیجه را با Regex شماره کارت، ایمیل و شناسه‌های محلی ترکیب کن. اگر هر Rule قطعی فعال شد، مقدار حساس را Redact کن؛ اگر فقط Score مدل مرزی بود، مورد را برای بازبینی انسانی Queue کن.

۴. Routing حوزه سلامت

اگر Health یا Self-harm فعال شد، پیام را حذف خودکار نکن. Intent را به مسیر مناسب بفرست: اطلاعات عمومی، هشدار عدم جایگزینی پزشک، پاسخ حمایتی بحران یا ارجاع فوری. متن اصلی فقط با دسترسی محدود و Retention کوتاه نگهداری شود.

۵. Eval فارسی چندسبکی

این مجموعه را به تفکیک فارسی رسمی، محاوره، Finglish، غلط املایی، Emoji و کدسوئیچ فارسی/انگلیسی ارزیابی کن. برای هر Category، Precision، Recall، F1 و False-positive rate را گزارش و Threshold انتخابی را با نسخه مدل ثبت کن.

بنچمارک و مقایسه عملکرد

چه داده عمومی برای نسخه 26.03 وجود دارد؟

مورد نتیجه قابل تأیید تاریخ/منبع
Precision / Recall / F1 کل منتشر نشده صفحه رسمی مدل، بررسی ۱۳ سپتامبر ۲۰۲۶
امتیاز تفکیکی ۱۱ Category منتشر نشده مستندات Moderation
Jailbreak detection rate منتشر نشده صفحه رسمی فقط وجود قابلیت را تأیید می‌کند
Benchmark چندزبانه عدد عمومی منتشر نشده ادعای کیفی Mistral
مقایسه عددی با رقیب منتشر نشده جدول رسمی هم‌شرط پیدا نشد

Mistral برای نسخه دقیق عبارت «Strong performance» را به کار می‌برد، اما عدد و Protocol عمومی ارائه نمی‌کند. بنابراین درج امتیاز ساختگی یا استفاده از Benchmark نسل 2024 به نام Moderation 2 غلط است. این نبود شفافیت، خود یک محدودیت قابل‌ذکر در خرید سازمانی است.

مقایسه قابل‌تأیید با نسل قبلی؛ مشخصات، نه Benchmark

ویژگی Mistral Moderation 2 Mistral Moderation 2024
Context ۱۲۸K ۸K
تعداد Category ۱۱ ۸
Dangerous بله در Taxonomy قدیمی نبود
Criminal بله در Taxonomy قدیمی نبود
Jailbreaking بله در Taxonomy قدیمی نبود
وضعیت GA و Active Deprecated از ۳۱ مارس ۲۰۲۶

این جدول از صفحه نسخه فعلی، راهنمای Moderation و صفحه نسخه قدیمی ساخته شده است. افزایش Context و Category پیشرفت محصول است، اما اثبات نمی‌کند Accuracy همه Classها بالاتر رفته است.

Benchmark منصفانه باید چه چیزی را بسنجد؟

معیار کاربرد
Macro/Weighted F1 تعادل کیفیت میان Classهای کم‌تعداد و پرتعداد
Recall هر Category چند مورد واقعاً خطرناک کشف می‌شود؟
False-positive rate چند پیام سالم بی‌دلیل Block می‌شود؟
PR-AUC کیفیت تفکیک در داده نامتوازن
Calibration error آیا Score با احتمال واقعی خطا هم‌خوان است؟
Jailbreak TPR در FPR ثابت تشخیص حمله بدون مسدود کردن بی‌رویه
Breakdown زبان و Dialect آیا کیفیت فارسی و کدسوئیچ افت می‌کند؟
p95 Latency و Availability آیا Guardrail گلوگاه Production است؟
Drift در نسخه و زمان آیا Threshold پس از Update معتبر می‌ماند؟

Dataset باید شامل مثال سالم نزدیک به مرز باشد: مقاله خبری خشونت، آموزش پزشکی، بحث حقوقی عمومی، نقل قول نفرت برای نقد و پیام بحران. فقط نمونه‌های واضح باعث Benchmark خوش‌بینانه و Threshold بد می‌شوند.

تحلیل برای کاربرد واقعی

نقطه قوت قابل اثبات Moderation 2، Coverage محصول است: ۱۱ Category، Context بلند، Raw score و Integration Inline. نقطه ضعف شواهد، نبود نرخ خطای عمومی است. برای همین نمی‌توان گفت در فارسی یا Jailbreak از همه رقبا بهتر است.

اگر تیم شما Mistral Chat/Agent استفاده می‌کند، Integration و قیمت رایگان مزیت عملی بزرگی دارند. اگر تصویر را Moderation می‌کنید، باید سرویس جداگانهٔ پشتیبان تصویر را ارزیابی کنید. اگر Policy شرکت بسیار اختصاصی است، Classifier سفارشی یا Rule engine می‌تواند در کنار Moderation 2 بهتر از یک Threshold عمومی عمل کند.

مقایسه با رقبا و جایگزین‌های مستقیم

گزینه نوع ورودی و تمرکز مزیت چه زمانی انتخاب بهتری است؟
Mistral Moderation 2 متن و مکالمه؛ ۱۱ Category ثابت ۱۲۸K، Jailbreak، Raw score، API رایگان Chat/Agent متنی و Integration سریع Mistral
Classifier سفارشی Mistral Category و داده اختصاصی سازمان انطباق با Policy محلی Fraud، Compliance یا Taxonomy ویژه کسب‌وکار

سرویس‌های مدیریت‌شده و Classifier سفارشی Benchmark هم‌معنا ندارند. Moderation 2 Taxonomy آماده و API مدیریت‌شده دارد؛ برای Policy محلی، تیم می‌تواند Rule engine و بازبینی انسانی را در کنار آن قرار دهد.

قیمت و API

براساس صفحه رسمی قیمت Mistral و مدل Moderation 2، در ۱۳ سپتامبر ۲۰۲۶ استفاده API این Classifier رایگان است.

قیمت صفر به معنای هزینه عملیاتی صفر نیست. هر فراخوانی Latency دارد، ممکن است Rate limit داشته باشد و به Logging، Monitoring، Human review و Fallback نیاز دارد. Mistral SLA یا ظرفیت نامحدود را صرفاً با واژه Free تضمین نمی‌کند.

برای کنترل نسخه از mistral-moderation-2603 استفاده کنید. اگر Alias یا مدل زیر سرویس در آینده تغییر کند، توزیع Score و Threshold را با Shadow traffic دوباره Calibrate کنید. Mistral به‌طور مشخص درباره نیاز احتمالی Recalibration هشدار داده است.

شروع استفاده از Mistral Moderation 2 در Buffalo147 AI

بهترین شروع، آزمایش چند پیام واضح و چند پیام مرزی از محصول واقعی شماست. فقط Flag نهایی را نگاه نکنید؛ Score هر Category، دلیل Policy و رفتار Threshold را مقایسه کنید. سپس تصمیم Allow/Review/Block را در Backend تعریف کنید، نه داخل Prompt کاربر.

شروع استفاده از Mistral Moderation 2 در Buffalo147 AI

جمع‌بندی؛ لایه ایمنی آماده، اما نه پاسخ کامل Trust & Safety

مهم‌ترین مزیت Mistral Moderation 2 ترکیب API رایگان، Context ۱۲۸K، ۱۱ Category، Jailbreak detection و Raw score است. برای تیمی که روی Mistral Chat یا Agent محصول می‌سازد، Guardrail Inline مسیر Integration کوتاهی دارد.

محدودیت اصلی، نبود Benchmark عمومی دقیق است. بدون Precision، Recall و Breakdown زبان نمی‌توان از روی صفحه محصول Threshold Production انتخاب کرد. Text-only بودن و پوشش ندادن خودکار خروجی نیز باید در معماری جبران شوند.

این مدل برای Pre/Post moderation، PII routing، کنترل Agent و مکالمه طولانی انتخاب خوبی است—به‌شرطی که با Policy روشن، Eval فارسی، Version pin، Rule قطعی و Human review ترکیب شود. یک Classifier می‌تواند هشدار بدهد؛ مسئولیت تصمیم و تجربه کاربر همچنان با سازنده محصول است.

سؤالات متداول

Mistral Moderation 2 چیست؟

یک Classifier ایمنی متنی از Mistral AI است که متن و مکالمه را در ۱۱ Category بررسی و Score/Flag برمی‌گرداند. مدل پاسخ تولید نمی‌کند.

آیا Mistral Moderation 2 رایگان است؟

بله، در آخرین بررسی ۱۳ سپتامبر ۲۰۲۶ صفحه رسمی مدل و قیمت آن را Free نشان می‌دادند. Rate limit و شرایط سرویس باید جدا بررسی شوند.

آیا Jailbreak را تشخیص می‌دهد؟

بله، jailbreaking یکی از Categoryهای رسمی نسخه 26.03 است. بااین‌حال این قابلیت جای Permission و Sandbox ابزار را نمی‌گیرد.

Context Window چقدر است؟

Context رسمی ۱۲۸K توکن است؛ برای مکالمه چندمرحله‌ای بلند مناسب‌تر از نسل ۸K قبلی است.

آیا تصویر را Moderation می‌کند؟

خیر، Moderation 2 سرویس Text classification است. برای متن و تصویر باید سرویس چندوجهی مرتبط را جداگانه ارزیابی کرد.

آیا خروجی مدل اصلی هم خودکار بررسی می‌شود؟

Guardrail Inline مستندشده روی ورودی اجرا می‌شود. برای خروجی باید Post-moderation مستقل در Pipeline اضافه شود.

چه Categoryهایی دارد؟

Sexual، Hate/Discrimination، Violence/Threats، Dangerous، Criminal، Self-harm، Health، Financial، Law، PII و Jailbreaking.

آیا Threshold قابل تغییر است؟

بله. API Raw score می‌دهد و Custom Guardrails Threshold هر Category را می‌پذیرد. Threshold باید با Dataset واقعی و هزینه False positive/negative تنظیم شود.

آیا برای فارسی مناسب است؟

Mistral عملکرد چندزبانه را ادعا می‌کند، اما امتیاز فارسی عمومی منتشر نشده است. Eval شامل محاوره، Finglish، کدسوئیچ و املای شکسته ضروری است.

چه زمانی Classifier سفارشی هم لازم است؟

وقتی دسته‌بندی‌های استاندارد برای Policy اختصاصی سازمان کافی نیستند، داده و برچسب‌های خود را برای سنجش Classifier سفارشی آماده کنید و نتیجه را کنار API مدیریت‌شده ارزیابی کنید.

منابع و روش راستی‌آزمایی

این مقاله برای Buffalo147 AI از صفر نوشته شده است. چون برای نسخه دقیق 26.03 امتیاز عمومی قابل‌بررسی منتشر نشده، هیچ عدد Benchmark یا برتری رقابتی حدس زده نشده و نبود داده به‌صورت شفاف گزارش شده است.

خواندنی‌های دیگر