GPT
M

MinerU2.5-Pro-2605-1.2B

קוד פתוח

opendatalabapache-2.02026-05-20

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • conversational

מודל ראייה ושפה קומפקטי שממיר מסמכים ותמונות עמוד לטקסט מובנה. מתאים למי שחייב חילוץ מדויק של נוסחאות, טבלאות ותרשימים בלי להחזיק שרת יקר.

  • 1.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 89,053הורדות בחודש

מה זה

במקום להגדיל את כמות הפרמטרים, המפתחים השאירו בסיס קטן של 1.2B פרמטרים ואימנו אותו על 65.5 מיליון עמודים עם סינון איכות קפדני. הוא מבוסס על ארכיטקטורת Qwen2VLForConditionalGeneration, ויודע לפרק מבנה של דף שלם, לזהות פסקאות קטועות, לחלץ תרשימים, לקרוא טבלאות מורכבות ולתרגם נוסחאות מתמטיות לטקסט.

במבחן OmniDocBench גרסה 1.6 המודל קיבל ציון כולל של 95.72, עם מרחק עריכת טקסט נמוך של 0.036 וציון של 97.15 בנוסחאות. המשמעות בשטח היא פחות שגיאות הקלדה בחילוץ ופחות שבירה של מבני נתונים, ברמה שעוקפת במדדים האלה מודלי ענק ייעודיים ומודלים כלליים כבדים בהרבה.

מתאים ל

  • חילוץ מאמרים מדעיים

    הוא מגיע לציון 97.15 בזיהוי נוסחאות וממיר דפים עמוסי מתמטיקה למרקגאון נקי בלי לאבד סמלים.

  • עיבוד דוחות עם טבלאות

    מתאים לחילוץ נתונים פיננסיים בזכות ציון של 93.62 במבנה טבלאות ותמיכה בתמונות שנמצאות בתוך התאים.

  • הכנת דאטה למערכות RAG

    הוא ממזג פסקאות מקוטעות בין שורות ומייצר מסמך רציף שמונע שבירת הקשר בתוך מאגרי וקטורים.

איפה זה נופל

המודל אומן והוגדר רשמית לשתי שפות בלבד, אנגלית וסינית. הוא לא מיועד לעברית, ומסמכים בעברית כנראה ישתבשו בכיווניות, בקריאת הגופנים ובסדר המילים. בנוסף, יכולת חיבור טבלאות שמתפרסות על פני כמה עמודים עדיין נמצאת בפיתוח וטרם שולבה במלואה, כך שאי אפשר לסמוך עליה כרגע. קצב עיבוד של שני עמודים לשנייה על כרטיס חזק הוא סביר, אבל רחוק מלהיות מהיר עבור ארכיונים של מיליוני מסמכים.

שאלות
נפוצות

האם המודל יצליח לחלץ מסמכים בעברית?

הוא לא מוגדר לתמוך בעברית, אלא בסינית ובאנגלית בלבד. אם תזינו לו עמוד בעברית, סביר שתקבלו ג'יבריש או טעויות קשות בסדר הקריאה מימין לשמאל.

מה ההבדל בין גרסה 2605 לגרסה 2604?

גרסת 2605 מתקנת זיהוי שגוי של בלוקים מסוג תמונה ומוסיפה שיפור בניתוח של תרשימים ודיאגרמות, בעוד שבציוני המדידה היבשים ההבדל ביניהן מינורי לחלוטין.

האם צריך להפעיל ניתוח תמונות בכל הרצה?

לא, האפשרות הזו כבויה כברירת מחדל בקוד. כדאי להדליק אותה רק אם המסמך מכיל תרשימי זרימה או גרפים שאתם באמת צריכים לפענח, כדי לחסוך זמן עיבוד.

איך מריצים

אתם מריצים אותו דרך חבילת mineru-vl-utils עם תמיכה ישירה ב־transformers או ב־vLLM. המשקל הכולל יושב על 2.2 גיגה בייט בלבד, כך שלא צריך מפלצת מחשוב בשביל להעלות אותו, וכרטיס מסך פשוט יספיק לרוב המשימות המקומיות.

המפתחים מדווחים על קצב של 2.12 פריימים לשנייה על כרטיס A100 יחיד כשעובדים עם vllm-async-engine. אם יש לכם נפח עבודה רציף של אלפי עמודים, עדיף להחזיק מופע עצמאי כזה. שירותי ענן חיצוניים שווים את זה רק אם אין לכם שום תשתית GPU זמינה או שמדובר בקריאות בודדות פעם ביום.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="opendatalab/MinerU2.5-Pro-2605-1.2B")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר ולסגור את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗