GPT
N

Nanonets-OCR2-3B

קוד פתוח

nanonetsרישיון לא דווח2025-10-13

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • OCR

המודל הזה ממיר מסמכים למרקדאון מובנה במקום לפלוט סתם טקסט גולמי. הוא מזהה תרשימים, חתימות ונוסחאות, ורץ בקלות על חומרה מקומית צנועה בזכות גודל קומפקטי.

  • 3.8Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.0 GBמשקל הקבצים
  • 11,664הורדות בחודש

מה זה

המודל מתבסס על ארכיטקטורת Qwen2.5-VL ומיועד לחילוץ נתונים חכם ממסמכים ותמונות. במקום להחזיר גוש טקסט אחיד, הוא מתייג אלמנטים שונים בעמוד, ממיר נוסחאות מתמטיות ללטך, מבודד חתימות לתגיות ייעודיות, ממיר תרשימי זרימה לקוד מרמייד ומתרגם תיבות סימון ליוניקוד. הוא גם מסוגל לענות על שאלות ישירות מתוך המסמך, ואם המידע לא מופיע בעמוד הוא פשוט מחזיר שלא צוין.

במבחני ביצועים של פענוח מרקדאון, המודל מפסיד לגרסת הפלוס הסגורה שלהם ב־54.58% מהמקרים ומנצח אותה רק ב־29.37%, אבל מול גרסאות קטנות כמו 1.5B הוא מציג עליונות ברורה עם הפסד של 14.78% בלבד. במענה על שאלות מתוך מסמכים הוא מגיע לציון של 89.43 במבחן DocVQA, תוצאה שעוקפת אפילו את Gemini 2.5 Flash ומראה שהבנת המבנה שלו חזקה מאוד לגודלו.

מתאים ל

  • הזנת מסמכים ל־LLM

    חילוץ קובצי PDF מורכבים למרקדאון ששומר על מבנה טבלאות, כותרות ותגיות תוכן עבור מערכות RAG.

  • דיגיטציה של טפסים חתומים

    זיהוי תיבות סימון ובידוד חתימות במסמכים משפטיים באמצעות תגיות ייעודיות שמונעות ערבוב עם הטקסט.

  • חילוץ מאמרים מדעיים

    המרת נוסחאות מתמטיות סדורות ישירות לקוד לטך ותרשימים לקוד מרמייד מבלי לאבד את ההקשר.

איפה זה נופל

היוצרים מציינים במפורש שטבלאות פיננסיות מורכבות נוטות להישבר בלי כוונון מיוחד, ודורשות הגדרת repetition_penalty קשיחה והנחיה טקסטואלית ארוכה כדי לחלץ אותן כ־HTML תקין. בנוסף, הדיוק תלוי באופן קריטי ברזולוציית התמונה שהזנתם, ודפים ברזולוציה שאינה אופטימלית יובילו להזיות או לפספוסי מילים. למרות שהמודל מאומן על שפות רבות, הכרטיס לא מציין תמיכה מפורשת בעברית, ולכן חובה לבדוק אותו מראש על מסמכים מקומיים ולוודא שהוא אינו הופך את כיוון הטקסט.

שאלות
נפוצות

האם כדאי להעדיף אותו על פני קריאה למודל ענן גדול?

אם אבטחת מידע קריטית לכם והמסמכים לא יכולים לצאת מהרשת המקומית, המודל הזה נותן איכות חילוץ מפתיעה ביחס לגודלו. אם אין מגבלת פרטיות ואתם צריכים את הדיוק המרבי בטבלאות סבוכות, מודל גדול בענן עדיין ייתן תוצאות אמינות יותר בלי שתצטרכו לשחק עם רזולוציות והנחיות מורכבות.

איך המודל מתמודד עם שאלות על מסמכים שלא מופיע בהם המידע?

במקום להמציא תשובה או לנחש, המודל אומן להחזיר באופן מפורש את המחרוזת שלא צוין כאשר התשובה נעדרת מהדף. זה הופך אותו לשימושי מאוד באימות עובדות אוטומטי ובסינון טפסים חסרים.

איך מריצים

המודל שוקל 7 גיגה בייט ומכיל כ־3.8 מיליארד פרמטרים, כך שכרטיס מסך בודד עם 12 או 16 גיגה זיכרון מריץ אותו בלי שום מאמץ. פקודת vllm serve פשוטה פותחת שרת מקומי, ואפשר לעבוד איתו ישירות דרך ספריית הטרנספורמרס. יש לו גרסת 1.5B קלה יותר שמתאימה לקצוות חלשים, וגרסת פלוס שזמינה רק כשירות ענן סגור.

אם יש לכם שרת עם מעבד גרפי פנוי, הרצה עצמית של המודל תחסוך עלויות ותשאיר את המידע הרגיש בתוך הרשת שלכם. אם אין לכם תשתית כזו או שאתם צריכים לפרוק עומסים פתאומיים של אלפי מסמכים בבת אחת, הקריאה ל־API של Docstrange דרך פקודת פוסט פשוטה תהיה פתרון מהיר בהרבה מהתעסקות בשרתים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="nanonets/Nanonets-OCR2-3B")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח בכרטיס. בפועל זה אומר שאין לכם שום אישור רשמי להשתמש במשקולות האלו במוצר מסחרי, וכל שילוב שלו באפליקציה עסקית חושף אתכם לסיכון משפטי עד שננונטס יפרסמו תנאי שימוש ברורים.

הרישיון המלא בעמוד המודל ↗