Jina AI، زیرمجموعهی شرکت Elastic، مدل jina-ocr-v1 را بهعنوان یک پارسر بصری سند منتشر کرد. این مدل ورودیهایی مثل PDF، اسکن، جدول، نمودار و فاکتور را میگیرد و در یک پاس خروجی Markdown تحویل میدهد. jina-ocr-v1 مجموعاً ۳.۴ میلیارد پارامتر دارد، اما در هر توکن حدود ۵۷۰ میلیون پارامتر فعال میشود.
معماری و دیکدینگ حدسی#
این مدل بر پایهی DeepSeek-OCR ساخته شده و اجزای کارآمدی آن را حفظ کرده است. بخش DeepEncoder با حدود ۳۸۰ میلیون پارامتر، یک صفحهی ۱۰۲۴×۱۰۲۴ را از ۴,۰۹۶ پچ به ۲۵۶ توکن بصری فشرده میکند و با حالت داینامیک رزولوشن تا ۱,۱۵۶ توکن بصری برای هر صفحه مصرف میکند. دیکدر از نوع DeepSeek-3B-MoE با ۱۲ لایه و سقف موقعیت ۳۲,۷۶۸ است.
نکتهی فنی اصلی، اضافه شدن هَدِ FastMTP برای دیکدینگ حدسی است. این مکانیزم در هر مرحله ۳ پیشنویس تولید میکند و دیکدر با تأیید طمعکارانه (Greedy) طولانیترین پیشوند منطبق را میپذیرد و یک توکن اضافه میسازد. در نتیجه سرعت بدون از دست رفتن کیفیت افزایش مییابد؛ در K=3 بهطور متوسط ۲.۷۳ توکن در هر مرحله ثبت میشود.
عملکرد و بنچمارکها#
در بنچمارکها، مدل نمرهی ۹۱.14 در OmniDocBench v1.6 و ۸۳.4 در olmOCR-Bench کسب کرده است. اگرچه از نظر دقت در صدر نیست (PaddleOCR-VL-1.6 نمرهی بالاتری دارد)، اما از نظر توان عملیاتی (Throughput) برجسته است. روی یک کارت A100 با همزمانی ۳۲، این مدل ۲.۵۷ صفحه در ثانیه پردازش میکند که بالاترین عدد در میان ۱۴ سیستم اندازهگیریشده است.
روی NVIDIA L4 (یک GPU کمهزینه)، سرعت دیکدینگ از ۴۲.۷ به ۸۳.۱ توکن در ثانیه رسید؛ یعنی شتاب ۱.۹۵ برابری با نرخ پذیرش ۵۷.۶ درصد.
در دسترس بودن#
وزنهای مدل با حجم حدود ۶.۸ گیگابایت در فرمت BF16 منتشر شده و از طریق Hugging Face و Jina Reader در دسترس است. مجوز استفاده از مدل CC BY-NC 4.0 است؛ یعنی استفاده تجاری نیازمند تماس با Jina AI است. برای اجرای محلی، FastMTP به نسخهی ۰.۲۱ به بعد از vLLM نیاز دارد.
تحلیل تحریریه: برای سازندگان ایجنت چه فرقی میکند؟#
انتشار jina-ocr-v1 یک گام فنی مهم است، اما نه انقلابی. اگر شما در حال ساخت سیستمهای RAG یا ایجنتهایی هستید که باید فاکتور و قرارداد بخوانند، این خبر یعنی یک چیز مشخص: حالا میتوانید با بودجهی سختافزاری L4 (که بسیار ارزانتر از A100 یا H100 است) سرعتی قابل قبول داشته باشید، بدون آنکه مجبور باشید به سرویسهای ابری گرانقیمت پناه ببرید.
اما دو نکته را در نظر داشته باشید. اول، مجوز غیرتجاری مدل یعنی اگر محصول شما قرار است پول در بیاورد، نمیتوانید همین مدل را مستقیم در پسزمینهی سرویس خود به کار ببرید و باید با Jina AI مذاکره کنید. دوم، این مدل هنوز به دقت مدلهای بزرگتر مثل Qwen3-VL یا PaddleOCR-VL نرسیده است؛ مزیت اصلیاش «سرعت در برابر هزینه» است، نه «بهترین دقت».
منبع: MarkTechPost






دیدگاهها
برای گذاشتن دیدگاه وارد شو
دیدگاهها فقط از حسابهای کاربری پذیرفته میشوند.
ورود / ثبتنامهنوز دیدگاهی ثبت نشده — اولین نفر باش.