Jina AI، زیرمجموعه‌ی شرکت Elastic، مدل jina-ocr-v1 را به‌عنوان یک پارسر بصری سند منتشر کرد. این مدل ورودی‌هایی مثل PDF، اسکن، جدول، نمودار و فاکتور را می‌گیرد و در یک پاس خروجی Markdown تحویل می‌دهد. jina-ocr-v1 مجموعاً ۳.۴ میلیارد پارامتر دارد، اما در هر توکن حدود ۵۷۰ میلیون پارامتر فعال می‌شود.

معماری و دیکدینگ حدسی#

این مدل بر پایه‌ی DeepSeek-OCR ساخته شده و اجزای کارآمدی آن را حفظ کرده است. بخش DeepEncoder با حدود ۳۸۰ میلیون پارامتر، یک صفحه‌ی ۱۰۲۴×۱۰۲۴ را از ۴,۰۹۶ پچ به ۲۵۶ توکن بصری فشرده می‌کند و با حالت داینامیک رزولوشن تا ۱,۱۵۶ توکن بصری برای هر صفحه مصرف می‌کند. دیکدر از نوع DeepSeek-3B-MoE با ۱۲ لایه و سقف موقعیت ۳۲,۷۶۸ است.

نکته‌ی فنی اصلی، اضافه شدن هَدِ FastMTP برای دیکدینگ حدسی است. این مکانیزم در هر مرحله ۳ پیش‌نویس تولید می‌کند و دیکدر با تأیید طمع‌کارانه (Greedy) طولانی‌ترین پیشوند منطبق را می‌پذیرد و یک توکن اضافه می‌سازد. در نتیجه سرعت بدون از دست رفتن کیفیت افزایش می‌یابد؛ در K=3 به‌طور متوسط ۲.۷۳ توکن در هر مرحله ثبت می‌شود.

عملکرد و بنچمارک‌ها#

در بنچمارک‌ها، مدل نمره‌ی ۹۱.14 در OmniDocBench v1.6 و ۸۳.4 در olmOCR-Bench کسب کرده است. اگرچه از نظر دقت در صدر نیست (PaddleOCR-VL-1.6 نمره‌ی بالاتری دارد)، اما از نظر توان عملیاتی (Throughput) برجسته است. روی یک کارت A100 با همزمانی ۳۲، این مدل ۲.۵۷ صفحه در ثانیه پردازش می‌کند که بالاترین عدد در میان ۱۴ سیستم اندازه‌گیری‌شده است.

روی NVIDIA L4 (یک GPU کم‌هزینه)، سرعت دیکدینگ از ۴۲.۷ به ۸۳.۱ توکن در ثانیه رسید؛ یعنی شتاب ۱.۹۵ برابری با نرخ پذیرش ۵۷.۶ درصد.

در دسترس بودن#

وزن‌های مدل با حجم حدود ۶.۸ گیگابایت در فرمت BF16 منتشر شده و از طریق Hugging Face و Jina Reader در دسترس است. مجوز استفاده از مدل CC BY-NC 4.0 است؛ یعنی استفاده تجاری نیازمند تماس با Jina AI است. برای اجرای محلی، FastMTP به نسخه‌ی ۰.۲۱ به بعد از vLLM نیاز دارد.

تحلیل تحریریه: برای سازندگان ایجنت چه فرقی می‌کند؟#

انتشار jina-ocr-v1 یک گام فنی مهم است، اما نه انقلابی. اگر شما در حال ساخت سیستم‌های RAG یا ایجنت‌هایی هستید که باید فاکتور و قرارداد بخوانند، این خبر یعنی یک چیز مشخص: حالا می‌توانید با بودجه‌ی سخت‌افزاری L4 (که بسیار ارزان‌تر از A100 یا H100 است) سرعتی قابل قبول داشته باشید، بدون آنکه مجبور باشید به سرویس‌های ابری گران‌قیمت پناه ببرید.

اما دو نکته را در نظر داشته باشید. اول، مجوز غیرتجاری مدل یعنی اگر محصول شما قرار است پول در بیاورد، نمی‌توانید همین مدل را مستقیم در پس‌زمینه‌ی سرویس خود به کار ببرید و باید با Jina AI مذاکره کنید. دوم، این مدل هنوز به دقت مدل‌های بزرگ‌تر مثل Qwen3-VL یا PaddleOCR-VL نرسیده است؛ مزیت اصلی‌اش «سرعت در برابر هزینه» است، نه «بهترین دقت».

منبع: MarkTechPost