Buffalo147 AI

خانه › بلاگ

Mistral OCR 4.1؛ بررسی مدل استخراج ساختاریافته اسناد با Bounding Box و Confidence

تصویر شاخص Mistral OCR 4.1 با نام درشت مدل و سند مالی دارای Bounding Box، برچسب Block و Confidence در تم مشکی و مسی

آخرین راستی‌آزمایی: ۱۳ سپتامبر ۲۰۲۶

در یک نگاه | Mistral OCR 4.1
تاریخ عرضه: روز دقیق عرضه در متن فعلی ثبت نشده است.
قیمت و شیوهٔ محاسبه: OCR API ۴ دلار / ۱۰۰۰ صفحه؛ Annotated Page / Document AI ۵ دلار / ۱۰۰۰ صفحه تعرفه و دسترسی را برای زمان خرید دوباره در منبع رسمیِ مقاله بررسی کنید.

مقدمه؛ OCR دیگر فقط خواندن چند خط متن نیست

OCR سنتی معمولاً تصویر صفحه را به رشته‌ای از کلمات تبدیل می‌کرد. این خروجی برای جستجوی ساده کافی بود، اما وقتی سند چندستونه، جدول، فرمول، امضا، Header و Caption دارد، فقط دانستن کلمات کافی نیست. سیستم باید بداند هر بخش کجاست، چه نقشی دارد و تا چه اندازه می‌توان به استخراج آن اعتماد کرد.

Mistral OCR 4.1 برای همین لایه ساختاری Document Intelligence طراحی شده است. این سرویس یک صفحه را به Markdown و مجموعه‌ای از Blockهای مرتب تبدیل می‌کند؛ برای هر Block می‌تواند مختصات، نوع ساختاری و Confidence برگرداند. نتیجه برای RAG، آرشیو دیجیتال، استخراج فاکتور و Human-in-the-loop بسیار مفیدتر از متن تخت است.

Mistral AI نسخه 4.1 را ۱۶ ژوئیه ۲۰۲۶ منتشر و در ۳۱ اوت همان سال GA اعلام کرد. تفاوت برجسته آن با OCR 4.0، اضافه شدن Confidence score در سطح Block است. در Master List این پروژه نام «Mistral OCR 4.1» حفظ شده، اما نام رسمی صفحه محصول «OCR 4.1» است.

Mistral OCR 4.1 چیست؟

OCR 4.1 جدیدترین Snapshot سرویس OCR تجاری Mistral و موتور Document AI این شرکت است. ورودی آن سند یا تصویر و خروجی پایه‌اش محتوای استخراج‌شده، Markdown صفحه، اطلاعات تصویر و جدول، Hyperlink، ابعاد صفحه و Metadata مصرف است.

اگر include_blocks=true فعال شود، هر صفحه آرایه‌ای از Blockها برمی‌گرداند. هر Block شامل نوع محتوا، مختصات گوشه بالا-چپ و پایین-راست و متن استخراج‌شده است. انواع رسمی عبارت‌اند از:

  • text، title و list؛
  • table، image و equation؛
  • caption، code و references؛
  • aside_text، header، footer و signature.

این مدل یک Chatbot عمومی نیست. وظیفه‌اش Parse کردن سند و ساخت خروجی قابل‌مصرف برای نرم‌افزار است. برای سؤال‌وپاسخ یا خلاصه‌سازی، خروجی OCR به مدل زبانی یا قابلیت Document Q&A متصل می‌شود.

جایگاه 4.1 در خانواده Mistral OCR

نسخه اولیه Mistral OCR در مارس ۲۰۲۵ عرضه شد؛ OCR 2 در مه ۲۰۲۵ و OCR 3 در دسامبر همان سال ادامه مسیر بودند. OCR 4.0 در ۲۳ ژوئن ۲۰۲۶ Bounding Box سطح پاراگراف و Structural block label را اضافه کرد. نسخه 4.1 همین پایه را با Confidence سطح Block کامل‌تر کرد.

Aliasهای mistral-ocr-latest و mistral-ocr-4 از ۱۶ ژوئیه ۲۰۲۶ به 4.1 اشاره می‌کنند. برای Production بهتر است شناسه ثابت mistral-ocr-4-1 استفاده شود تا تغییر Alias رفتار Pipeline را بی‌خبر عوض نکند.

OCR 4.0 هنوز در فهرست مدل‌ها دیده می‌شود و OCR 3 برای Integrationهای موجود باقی مانده است، اما Mistral 4.1 را جدیدترین سرویس معرفی می‌کند. نسل‌های 2025 قدیمی‌تر یا Deprecated هستند؛ هنگام مهاجرت باید خروجی JSON، جدول و Placeholderهای تصویر Regression test شوند.

قابلیت‌های اصلی Mistral OCR 4.1

استخراج متن با حفظ ساختار و ترتیب خواندن

سرویس برای هر صفحه Markdown تولید می‌کند و تلاش دارد Heading، Paragraph، List، Table و Equation را در ترتیب خواندن حفظ کند. این ساختار برای Chunking بهتر است؛ زیرا یک عنوان از پاراگراف زیرش جدا و ستون‌های صفحه بی‌منطق به هم دوخته نمی‌شوند.

شماتیک روند ورودی، مدل و خروجی برای Mistral OCR 4.1
نمای شماتیک روند درخواست تا خروجی برای Mistral OCR 4.1؛ قابلیت‌های دقیق در متن مقاله آمده‌اند.

هیچ مدل OCR بی‌خطا نیست. صفحه کج، Scan کم‌نور، Watermark، دست‌خط و Font بسیار ریز می‌توانند ترتیب یا متن را خراب کنند. Preview بصری و نمونه‌گیری انسانی برای آرشیو حساس لازم است.

Bounding Box سطح پاراگراف

با include_blocks=true، مختصات هر Block نسبت به صفحه برگردانده می‌شود. رابط کاربری می‌تواند هنگام نمایش پاسخ RAG، همان ناحیه سند را Highlight کند؛ ابزار Redaction نیز می‌تواند به‌جای جستجوی مبهم متن، محدوده مشخص صفحه را هدف بگیرد.

Bounding Box به‌تنهایی معنای قطعی نمی‌سازد. اگر مدل یک Caption را به‌عنوان Paragraph تشخیص دهد، مختصات درست اما Label غلط خواهد بود. برای همین 4.1 Confidence نوع Block را هم ارائه می‌کند.

Confidence در سطح Page، Block و Word

پارامتر confidence_scores_granularity سه مقدار اصلی دارد:

  • page: میانگین و کمینه Confidence صفحه؛
  • block: آمار صفحه و Confidence محتوای هر Block، همراه Confidence نوع Block؛
  • word: آمار صفحه و آرایه Confidence واژه‌ها.

در سطح Block سه فیلد مهم وجود دارد: میانگین Confidence متن، کمترین Confidence متن و Confidence برچسب ساختاری. برای Block غیرمتنی مانند تصویر، Confidence محتوای متنی می‌تواند null باشد.

این نمره Probability کالیبره‌شده برای همه Domainها نیست. Threshold مناسب فاکتور فارسی ممکن است با مقاله علمی انگلیسی فرق کند. تیم باید Confidence را روی Ground truth داخلی Calibrate کند و مثلاً فقط Blockهای کم‌اعتماد را برای بازبینی انسانی بفرستد.

تشخیص جدول، فرمول، تصویر و امضا

مدل Table، Equation، Image، Signature و Caption را به‌عنوان Block جدا می‌شناسد. خروجی جدول می‌تواند Inline Markdown باشد یا با table_format در فیلد جدا به شکل Markdown/HTML برگردد. تصویر و جدول با ID و Placeholder به خروجی صفحه متصل می‌شوند.

تشخیص وجود امضا به معنای احراز هویت امضاکننده یا اعتبار حقوقی سند نیست. OCR می‌تواند محدوده امضا و نام خوانا را استخراج کند؛ تأیید اصالت وظیفه سامانه دیگری است.

پارامترهای extract_header و extract_footer بخش تکراری صفحه را جدا می‌کنند. این جداسازی مانع می‌شود نام شرکت یا شماره صفحه در هر Chunk RAG تکرار شود. Hyperlinkهای تشخیص‌داده‌شده نیز در خروجی صفحه قرار می‌گیرند.

برای سندی که Header آن حاوی شماره پرونده مهم است، حذف خودکار مناسب نیست. قبل از فیلتر کردن Blockها مشخص کنید کدام Metadata باید در Index بماند.

اسناد و فرمت‌های رایج سازمانی

در API می‌توان PDF را با URL عمومی، Base64 یا File upload ارسال کرد. تصویر با URL یا Base64 پذیرفته می‌شود. مستندات PNG، JPEG/JPG، AVIF، PDF، PPTX و DOCX را نمونه می‌زنند؛ اعلان OCR 4 نیز از PDF، DOC، PPT و OpenDocument نام می‌برد.

پشتیبانی فرمت به معنای بازسازی کامل فایل اصلی نیست. Macro، Comment، Animation، Track Changes یا Object تعبیه‌شده ممکن است به خروجی OCR تبدیل نشوند. برای هر نوع فایل واقعی، Test مستقل لازم است.

پوشش چندزبانه گسترده

Mistral برای خانواده OCR 4 از ۱۷۰ زبان در ۱۰ گروه زبانی صحبت می‌کند و در ارزیابی داخلی، گروه‌های خاورمیانه و زبان‌های کم‌منبع را نیز پوشش داده است. فهرست مثال شامل عربی، فارسی، عبری و چند خط Indic است.

این ادعا Vendor-reported است و کیفیت هر زبان یکسان نیست. برای فارسی باید اتصال حروف، نیم‌فاصله، اعداد فارسی/لاتین، متن راست‌به‌چپ، جدول دو‌زبانه و تاریخ شمسی آزمایش شوند.

Structured Annotations و Document AI

علاوه بر OCR خام، می‌توان JSON Schema برای document_annotation یا bbox_annotation تعریف کرد. Mistral می‌گوید در این حالت خروجی OCR به mistral-small-2603 داده می‌شود تا فیلدهای موردنظر را به شکل Schema تولید کند؛ Annotation تصویر نیز می‌تواند فراخوانی Vision-Language جداگانه ایجاد کند.

این تمایز در هزینه و اعتبار مهم است. متن OCR، Structured extraction و Annotation تصویر لایه‌های یکسانی نیستند. هر فیلد JSON باید با متن و Bounding Box منبع قابل ردیابی باشد.

Batch و استقرار سازمانی

برای آرشیو بزرگ، Batch API پردازش موازی و تخفیف دارد. Mistral OCR 4 را مدل متمرکز و کوچک توصیف کرده که امکان Self-managed deployment در یک Container برای مشتریان سازمانی دارد. Self-hosting عمومی و وزن آزاد همان مفهوم نیست؛ شرایط استقرار باید قراردادی بررسی شود.

قابلیت‌هایی که در این مدل نیست

OCR 4.1 Web Search، تولید تصویر، تولید ویدیو یا صوت ندارد و برای ورودی Raw audio/video ساخته نشده است. Tool Calling و Reasoning عمومی نیز قابلیت اصلی Endpoint OCR نیستند. هر Agent یا تصمیم تجاری روی خروجی، لایه‌ای جدا از مدل استخراج سند است.

مهم‌ترین نقاط قوت

خروجی قابل ردیابی تا صفحه و ناحیه

Bounding Box اجازه می‌دهد متن استخراج‌شده به محل واقعی‌اش روی صفحه متصل بماند. این ویژگی برای Citation، Audit، Redaction و رابط بررسی انسانی از چند امتیاز بیشتر در Character accuracy ارزش عملی بیشتری دارد.

Confidence سطح Block در نسخه 4.1

نسخه تازه می‌تواند بگوید کدام Paragraph یا Table و حتی نوع Block اعتماد پایین‌تری دارد. Pipeline به‌جای رد یا قبول کل سند، فقط قسمت مشکوک را Escalate می‌کند. این طراحی هزینه بازبینی انسانی را هدفمند می‌کند.

پشتیبانی از Layoutهای متنوع

Table، Equation، Code، Signature و Aside labelهای جدا دارند. برای مقاله علمی، قرارداد، گزارش مالی و فرم سازمانی، حفظ این نقش‌ها کیفیت Chunking و Retrieval را بهتر می‌کند.

قیمت صفحه‌ای شفاف

API پایه ۴ دلار به‌ازای هزار صفحه است. این مدل قیمت‌گذاری برای آرشیو قابل پیش‌بینی‌تر از Token billing است. Batch طبق اعلان رسمی هزینه پایه را ۵۰٪ کاهش می‌دهد.

مسیر Cloud تا Self-hosting سازمانی

API برای شروع سریع مناسب است و Self-managed container برای Residency یا Compliance گزینه مهمی است. بااین‌حال قیمت و شرایط Self-host عمومی نیست و باید در TCO سخت‌افزار و عملیات لحاظ شود.

محدودیت‌ها و نقاط ضعف

Benchmark دقیق 4.1 منتشر نشده است

امتیازهای 85.20، 93.07 و 0.98 در اعلان OCR 4.0 منتشر شده‌اند. Mistral برای Update 4.1 نتیجه عددی جدا یا مقایسه نسخه‌به‌نسخه ارائه نکرده است. بنابراین این اعداد فقط نزدیک‌ترین شواهد خانواده‌اند و نه امتیاز قطعی Snapshot 4.1.

سه معیار ارزیابی عملی برای Mistral OCR 4.1
معیارهای پیشنهادی برای آزمون Mistral OCR 4.1 با کار واقعی؛ این تصویر دادهٔ بنچمارک یا امتیاز گزارش‌شده نیست.

نتایج اصلی توسط سازنده بازتولید شده‌اند

Mistral می‌گوید همه امتیازهای رقبا در جدول‌های OCR 4 بازتولید داخلی هستند. نام و Raw score رقبا در متن قابل‌دسترس اعلان درج نشده است. ارزیابی انسانی Blind و Annotator مستقل دارد، اما Dataset و همه خروجی‌های Pairwise عمومی نشده‌اند.

خطای Ground truth و Scoring

خود Mistral توضیح می‌دهد که OlmOCRBench و OmniDocBench با معادله LaTeX معادل، شکست کلمه میان ستون‌ها، Header/Footer و Annotation اشتباه مشکل دارند. Aggregate score می‌تواند خروجی درست را جریمه یا خطای واقعی را پنهان کند.

Confidence نیازمند کالیبراسیون Domain است

عدد 0.9 الزاماً به معنای ۹۰٪ صحت در Dataset شما نیست. اگر Threshold بدون Label داخلی انتخاب شود، Pipeline ممکن است سند خطرناک را Auto-approve یا حجم بزرگی از متن سالم را بی‌دلیل به انسان بفرستد.

OCR تصمیم‌گیر نیست

اعلان رسمی صریحاً کاربرد پزشکی تشخیصی، قضاوت حقوقی، تصمیم مالی حساس، سیستم Safety-critical و پردازش Real-time را خارج از دامنه می‌داند. خروجی مدل باید داده ورودی تصمیم باشد، نه تصمیم نهایی.

زبان و Layout واقعی می‌تواند متفاوت باشد

صفحه اسکن‌شده فارسی با Stamp، جدول راست‌به‌چپ و متن دست‌نویس ممکن است با Benchmark عمومی فاصله داشته باشد. ۱۷۰ زبان یک عدد پوشش است و تضمین کیفیت برابر نیست.

Premier و وزن غیرعمومی

OCR 4.1 مدل Premier است. پارامتر، معماری دقیق، Context توکنی و وزن دانلود عمومی اعلام نشده‌اند. Self-hosting سازمانی نباید با Open weights اشتباه گرفته شود.

کاربردهای واقعی Mistral OCR 4.1

ساخت RAG با Citation بصری

سند به Blockهای عنوان، متن و جدول تقسیم می‌شود. هر Chunk همراه شماره صفحه و Bounding Box وارد Index می‌شود. هنگام پاسخ، کاربر علاوه بر Citation می‌تواند همان ناحیه منبع را Highlight شده ببیند.

استخراج فاکتور با مسیر بازبینی انسانی

OCR متن و جدول Line item را می‌خواند؛ Annotation فیلدهایی مانند شماره فاکتور، تاریخ و مبلغ را در JSON می‌سازد. اگر کمینه Confidence یک Block از Threshold پایین‌تر باشد یا جمع اقلام با Total نخواند، سند به اپراتور می‌رود.

دیجیتالی کردن آرشیو چندزبانه

PDFهای اسکن‌شده به Markdown ساختاریافته تبدیل و Header/Footerهای تکراری جدا می‌شوند. قبل از Index، نمونه‌ای از هر دهه، زبان و کیفیت Scan دستی ارزیابی می‌شود تا Bias آرشیو مشخص باشد.

پردازش مقاله علمی و گزارش فنی

Equation، Figure، Caption و Reference به Blockهای جدا تبدیل می‌شوند. این کار برای جستجوی فرمول و اتصال توضیح تصویر مفید است، اما معادلات حساس باید با رندر LaTeX و Ground truth بررسی شوند.

Redaction قابل ممیزی

مدل محل Paragraph و Block را می‌دهد؛ یک NER یا Rule جدا PII را تشخیص می‌دهد و ابزار PDF ناحیه را می‌پوشاند. فایل نهایی باید Rasterize/flatten و از نظر لایه متن پنهان کنترل شود؛ Bounding Box مدل به‌تنهایی Redaction امن نیست.

طبقه‌بندی و Split پرونده‌های ترکیبی

نوع Block، عنوان‌ها و Page boundary به Pipeline کمک می‌کنند یک PDF شامل چند قرارداد و ضمیمه را بخش‌بندی کند. تصمیم Split باید با Rule شماره پرونده و Test انسانی کنترل شود.

این مدل مناسب چه کسانی است؟

  • تیم‌های RAG و Enterprise Search؛
  • کسب‌وکارهای پردازش فاکتور، فرم و قرارداد؛
  • آرشیوها، کتابخانه‌ها و پروژه‌های Digitization چندزبانه؛
  • توسعه‌دهندگان Document AI و Workflowهای Agentic؛
  • سازمان‌های نیازمند Bounding Box، Citation و Human review؛
  • تیم‌های Compliance که گزینه Self-managed را بررسی می‌کنند.

برای خواندن چند تصویر ساده، OCR سبک‌تر یا موتور سنتی ممکن است ارزان‌تر باشد. برای تصمیم پزشکی یا حقوقی، OCR 4.1 فقط لایه استخراج است و متخصص انسانی ضروری می‌ماند.

مشخصات فنی

مشخصه مقدار تأییدشده
Developer Mistral AI
Model family Mistral OCR / Document AI
Official name OCR 4.1
Release / GA انتشار ۱۶ ژوئیه ۲۰۲۶؛ GA در ۳۱ اوت ۲۰۲۶
Model type OCR و Document Intelligence؛ Premier
API ID mistral-ocr-4-1
Aliases mistral-ocr-latest و mistral-ocr-4 در تاریخ بررسی
Input PDF، سند Office/OpenDocument و تصویر از URL، Base64 یا Upload بسته به نوع
Output Markdown، Blockها، Bounding Box، جدول/تصویر، Hyperlink، Header/Footer، Confidence و JSON Annotation اختیاری
Block labels متن، عنوان، فهرست، جدول، تصویر، معادله، Caption، Code، Reference، Aside، Header، Footer و Signature
Confidence granularity Page، Block و Word
Languages ادعای رسمی خانواده OCR 4: ۱۷۰ زبان در ۱۰ گروه
Context Window به‌صورت توکن عمومی اعلام نشده
Maximum Output عمومی اعلام نشده؛ خروجی صفحه‌محور است
Web Search / Tool Calling خیر؛ متعلق به Pipeline میزبان نیست
Audio / Video / Generation خیر
Batch API بله
API availability GA؛ /v1/ocr
Open weights تأیید نشده؛ Self-managed سازمانی با قرارداد جدا

۵ نمونه Prompt و Schema کاربردی

OCR خام معمولاً به Prompt طولانی نیاز ندارد؛ ارزش Prompt در Document Annotation و Instruction لایه ساختاری است.

۱. استخراج فاکتور به JSON

این سند را پردازش کن و خروجی را مطابق Schema شامل invoice_number، issue_date، seller، buyer، currency، line_items، subtotal، tax و total بساز. هیچ عددی را محاسبه یا حدس نزن؛ مقدار ناخوانا را null قرار بده و برای هر فیلد شماره صفحه و Block مرتبط را نگه دار.

۲. RAG با حفظ Citation

Blockها را در ترتیب خواندن برگردان. Header و Footer را جدا نگه دار، هر Table و Caption را به هم متصل کن و برای هر Chunk شناسه صفحه، Bounding Box و نوع Block بساز. متن دو Block نامرتبط را فقط برای رسیدن به طول ثابت ادغام نکن.

۳. کنترل Confidence سطح Block

include_blocks=true و confidence_scores_granularity="block" را فعال کن. هر Block با کمینه Confidence کمتر از Threshold داخلی را در صف human_review قرار بده؛ Block غیرمتنی با Confidence محتوای null را خطا تلقی نکن.

۴. گزارش علمی با فرمول

عنوان‌ها، Paragraphها، Equationها، Figureها، Captionها و References را جدا استخراج کن. LaTeX را عین خروجی OCR نگه دار و هیچ فرمولی را بازنویسی نکن. ارتباط Figure با نزدیک‌ترین Caption را همراه صفحه و مختصات ثبت کن.

۵. سند فارسی راست‌به‌چپ

متن فارسی و اعداد را بدون ترجمه استخراج کن. ترتیب ستون‌ها را از راست به چپ بررسی کن، نیم‌فاصله را بی‌دلیل حذف نکن و Stamp، امضا و متن دست‌نویس را Block جدا قرار بده. بخش ناخوانا را با Confidence و مختصات برای بازبینی انسانی علامت بزن.

بنچمارک و مقایسه عملکرد

وضعیت شواهد برای نسخه دقیق 4.1

Mistral برای 4.1 Benchmark تازه و تفکیک‌شده منتشر نکرده است. جدول زیر اعداد رسمی OCR 4.0/خانواده OCR 4 را نشان می‌دهد، چون نزدیک‌ترین پایه فنی اعلام‌شده‌اند. این امتیازها را نباید بدون آزمایش به 4.1 نسبت قطعی داد.

Benchmark چه چیزی را می‌سنجد؟ نتیجه OCR 4 تاریخ وضعیت منبع
OlmOCRBench کیفیت تبدیل PDF پیچیده و ترتیب/ساختار خروجی ۸۵٫۲۰ ۲۳ ژوئن ۲۰۲۶ Vendor-reported؛ بازتولید داخلی Mistral
OmniDocBench Parsing جامع اسناد، Layout و انواع محتوا ۹۳٫۰۷ ۲۳ ژوئن ۲۰۲۶ Vendor-reported؛ با هشدار Scoring
Crawl Multilingual OCR چندزبانه در هشت گروه ارزیابی‌شده ۰٫۹۸ ۲۳ ژوئن ۲۰۲۶ Benchmark داخلی Mistral
Human preference ترجیح خروجی در Pairwise blind روی ۶۰۰+ سند و ۱۲+ زبان میانگین Win rate برابر ۷۲٪ ۲۳ ژوئن ۲۰۲۶ Vendor-organized؛ Annotatorهای مستقل

منبع: اعلان رسمی Mistral OCR 4. سازنده می‌گوید OCR 4 در میان سیستم‌های آزموده‌شده اول بوده، اما Raw score و نام همه رقبا در متن عمومی درج نشده‌اند؛ بنابراین برای پر کردن جدول رقیب، عدد حدس نمی‌زنیم.

آیا مقایسه مستقیم با رقبا ممکن است؟

داده لازم وضعیت عمومی برای Snapshot دقیق 4.1
امتیاز مستقل 4.1 روی OlmOCRBench قابل تأیید پیدا نشد
امتیاز مستقل 4.1 روی OmniDocBench قابل تأیید پیدا نشد
Raw score رقبای جدول رسمی در متن اعلان منتشر نشده
A/B عددی 4.1 در برابر 4.0 منتشر نشده
ارزیابی Confidence سطح Block Benchmark عمومی اعلام نشده

مقایسه عددی 4.1 با Google Document AI، Azure AI Document Intelligence، Amazon Textract، Nanonets یا Parserهای Agentic بدون Dataset، نسخه و تنظیم یکسان منصفانه نیست. برخی سرویس‌ها Character recognition، بعضی Field extraction و بعضی Question answering را می‌سنجند.

محدودیت‌های خود Benchmarkها

Mistral پنج مشکل را گزارش کرده است: Ground truth اشتباه، LaTeXهای معادل با String متفاوت، Segment شدن Equation، شکست کلمه و ترتیب ستون، و Attribution متفاوت Header/Footer. این موارد نشان می‌دهند امتیاز Aggregate باید Directional دیده شود.

نتیجه Human preference به کاربرد واقعی نزدیک‌تر است، ولی هنوز Evaluation سازنده و Dataset غیرعمومی کامل است. برای سند فارسی، معیارهای مهم‌تر می‌توانند Character/Word error، حفظ ترتیب RTL، دقت عدد و تاریخ، Table cell accuracy، Block IoU، دقت Block label و Calibration Confidence باشند.

Eval پیشنهادی Buffalo147 برای استفاده واقعی

حداقل ۲۰۰ صفحه از Layoutهای واقعی را Label کنید و نتایج را جداگانه گزارش دهید:

معیار دلیل اهمیت
CER/WER به تفکیک زبان دقت کاراکتر و واژه
Exact match اعداد و شناسه‌ها جلوگیری از خطای مالی/پرونده
Table cell accuracy صحت ساختار جدول، نه فقط متن
Reading-order accuracy جلوگیری از ادغام ستون‌ها
Block label F1 دقت عنوان، جدول، معادله و امضا
Bounding-box IoU تطابق محل Block با Ground truth
Confidence calibration آیا Score واقعاً احتمال خطا را جدا می‌کند؟
هزینه و p95 زمان هر صفحه ظرفیت عملی Production

OCR 4 در شواهد رسمی روی ساختار و چندزبانگی قوی است؛ اما مهم‌ترین قابلیت جدید 4.1—Confidence سطح Block—هنوز Benchmark عمومی ندارد. رقیبی که در فاکتور فارسی یا دست‌خط Dataset شما بهتر Calibrate می‌شود، می‌تواند با امتیاز عمومی پایین‌تر انتخاب مناسب‌تری باشد.

مقایسه با رقبای مستقیم

گزینه نقطه قوت محدودیت مقایسه مناسب‌تر برای
Mistral OCR 4.1 Bounding Box پاراگراف، Block label و Confidence بلوکی در API واحد Benchmark مستقل دقیق 4.1 کم است RAG، Citation و Human review ساختاری
Google Document AI Processorهای سازمانی و اتصال عمیق به Google Cloud قیمت/Processor و Dataset متفاوت تیم‌های کاملاً مستقر در GCP
Azure AI Document Intelligence مدل‌های Prebuilt و اکوسیستم Microsoft معیار و Schema با Mistral یکسان نیست Workflowهای Azure و Form processing
Amazon Textract استخراج Form/Table و ادغام AWS خروجی و Benchmark هم‌شرط نیست Pipelineهای AWS و S3
Parserهای Agentic امکان Reasoning و QA پیچیده روی سند معمولاً Latency و هزینه بالاتر سؤال پیچیده‌ای که استخراج خام کافی نیست

برای انتخاب، فقط OCR accuracy را نسنجید. Data residency، Bounding Box، Confidence، Schema، Batch، Latency، قیمت، Audit trail و کیفیت زبان واقعی همگی تعیین‌کننده‌اند.

قیمت و API

در صفحه رسمی OCR 4.1 و آخرین بررسی ۱۳ سپتامبر ۲۰۲۶:

سرویس قیمت استاندارد
OCR API ۴ دلار / ۱۰۰۰ صفحه
Annotated Page / Document AI ۵ دلار / ۱۰۰۰ صفحه
OCR از طریق Batch API ۲ دلار / ۱۰۰۰ صفحه طبق تخفیف ۵۰٪ اعلان OCR 4

قیمت Annotation تصویر یا Callهای اضافه می‌تواند به تنظیمات Pipeline وابسته باشد؛ برآورد را با یک Batch واقعی کنترل کنید. Endpoint اصلی /v1/ocr است و مدل ثابت mistral-ocr-4-1 انتخاب مطمئن‌تری برای Version pinning محسوب می‌شود.

قیمت Self-managed عمومی نشده است. Storage، Egress، Upload، Human review و مدل زبانی پس از OCR نیز در نرخ صفحه‌ای پایه نیستند. قیمت‌ها ممکن است تغییر کنند و باید پیش از قرارداد دوباره بررسی شوند.

شروع استفاده از Mistral OCR 4.1 در Buffalo147 AI

برای آزمون درست، یک PDF تمیز و یک سند واقعاً دشوار از کار خودتان آماده کنید. خروجی Markdown را کنار Blockها، Bounding Box و Confidence ببینید و فقط به ظاهر متن توجه نکنید. سپس Threshold بازبینی را براساس خطاهای همان Dataset تنظیم کنید.

شروع استفاده از Mistral OCR 4.1 در Buffalo147 AI

جمع‌بندی؛ ارزش 4.1 در قابلیت اعتمادپذیری Pipeline است

مزیت اصلی Mistral OCR 4.1 فقط خواندن متن نیست؛ ساخت یک نمایش قابل‌ردیابی از سند است. Paragraph Bounding Box، Block label و Confidence سطح Block اجازه می‌دهند RAG Citation‌محور، Redaction، استخراج فاکتور و Human review دقیق‌تر ساخته شوند.

محدودیت مهم، نبود Benchmark مستقل برای Snapshot دقیق 4.1 است. اعداد قدرتمند OCR 4 توسط سازنده گزارش شده‌اند و خود Mistral نیز محدودیت Scoring را پذیرفته است. Confidence هم بدون Calibration داخلی نباید تصمیم خودکار بسازد.

اگر خروجی Markdown ساختاریافته، صفحه و مختصات منبع، چندزبانگی و API صفحه‌ای می‌خواهید، 4.1 انتخاب جدی است. اگر فقط چند تصویر ساده دارید یا نیاز شما تصمیم تخصصی بالادستی است، سرویس سبک‌تر یا Pipeline چندمرحله‌ای ممکن است مناسب‌تر باشد.

سؤالات متداول

Mistral OCR 4.1 چیست؟

نسخه جدید سرویس OCR و Document AI شرکت Mistral است که اسناد و تصاویر را به Markdown و Blockهای ساختاریافته با Bounding Box، Label و Confidence تبدیل می‌کند.

تفاوت OCR 4.1 و OCR 4.0 چیست؟

4.0 Bounding Box پاراگراف و نوع Block را معرفی کرد؛ 4.1 Confidence score سطح Block را اضافه کرده است. Benchmark عددی جدا برای 4.1 منتشر نشده است.

آیا Mistral OCR 4.1 فارسی را پشتیبانی می‌کند؟

Mistral خانواده زبان‌های خاورمیانه و فارسی را در پوشش OCR 4 ذکر می‌کند. کیفیت سند راست‌به‌چپ، جدول و اسکن واقعی باید با Eval فارسی اختصاصی سنجیده شود.

چه فایل‌هایی را می‌توان پردازش کرد؟

PDF، تصویر و فرمت‌های رایج سند مانند DOCX و PPTX در مستندات نمونه آمده‌اند. روش ارسال می‌تواند URL، Base64 یا File upload باشد و جزئیات هر فرمت باید در API کنترل شود.

آیا OCR 4.1 API دارد؟

بله. Endpoint /v1/ocr و شناسه نسخه‌ای mistral-ocr-4-1 به‌صورت GA در دسترس‌اند. Alias mistral-ocr-latest نیز هنگام بررسی به همین نسخه اشاره می‌کرد.

قیمت آن چقدر است؟

OCR استاندارد ۴ دلار و صفحه Annotated برابر ۵ دلار به‌ازای هزار صفحه است. اعلان Mistral برای Batch تخفیف ۵۰٪ و نرخ ۲ دلار به‌ازای هزار صفحه ذکر می‌کند.

آیا وزن مدل قابل دانلود است؟

وزن عمومی برای 4.1 تأیید نشده است. Mistral گزینه Self-managed تک‌Container را برای مشتری سازمانی مطرح کرده که شرایط قراردادی جدا دارد.

آیا می‌توان به Confidence مدل اعتماد کامل کرد؟

خیر. Confidence برای اولویت‌بندی مفید است، اما باید روی اسناد واقعی شما Calibrate شود و برای تصمیم حساس با Rule و بازبینی انسانی ترکیب گردد.

OCR 4.1 بهتر است یا Google Document AI؟

پاسخ به نوع سند، زبان، Cloud، Schema، Residency و هزینه بستگی دارد. چون Benchmark مستقل هم‌شرط دقیق 4.1 در دسترس نیست، A/B Test روی Dataset خودتان لازم است.

منابع و روش راستی‌آزمایی

این مقاله برای Buffalo147 AI از صفر نوشته شده است. امتیازهای Benchmark مربوط به OCR 4.0/خانواده OCR 4 هستند و به‌عنوان Vendor-reported معرفی شده‌اند؛ برای نسخه 4.1 هیچ عدد جداگانه‌ای جعل یا استنتاج نشده است.

خواندنی‌های دیگر