GPT
M

MinerU2.5-Pro-2604-1.2B

קוד פתוח

opendatalabapache-2.02026-04-02

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • conversational

המרת מסמכי PDF ותמונות למארקדאון מדויק עם טבלאות ונוסחאות. הוא קטן במיוחד, רץ על חומרה צנועה ומנצח מודלים ענקיים במבחני חילוץ.

  • 1.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 189,747הורדות בחודש

מה זה

המודל מתמקד במשימה אחת בלבד, חילוץ מבנה וטקסט ממסמכים והפיכתם למארקדאון או JSON. הבסיס שלו הוא ארכיטקטורת Qwen2VL בגודל של 1.2 מיליארד פרמטרים, אבל המפתחים לא שינו את הארכיטקטורה אלא אימנו אותו על דאטהסט ענק של 65.5 מיליון עמודים תוך שימוש בסינון איכות קפדני. הוא כולל תמיכה בזיהוי תמונות בתוך טבלאות, ניתוח תרשימים ואיחוד פסקאות חתוכות.

במדד OmniDocBench v1.6 המודל קיבל ציון כולל של 95.69, כשהוא עוקף מודלים ייעודיים כמו PaddleOCR-VL-1.5 וגם ענקים כלליים ברמה של Gemini 3 Pro ו־Qwen3-VL-235B. הנתון הזה לא אומר שהוא חכם יותר בהבנת שפה, אלא שהוא פשוט מדויק בהרבה בשחזור מבנה פיזי, פענוח נוסחאות מתמטיות צפופות עם ציון 97.29 ושמירה על טבלאות מורכבות בלי לשבור עמודות.

מתאים ל

  • הכנת דאטה לצינורות RAG

    מפרק קובצי PDF עמוסים לטקסט נקי ומובנה במארקדאון כדי לשפר את איכות השליפה והחיפוש.

  • סריקת מאמרים ודוחות מדעיים

    מחלץ נוסחאות מתמטיות דחוסות ותרשימים בדיוק גבוה בלי לאבד את ההקשר של הפסקאות.

  • פענוח טבלאות מורכבות

    מזהה מבנה של טבלאות קשות כולל תמונות שמוטמעות בתוך התאים עצמם.

איפה זה נופל

המודל תומך רשמית רק באנגלית ובסינית, כך שאינו מתאים לחילוץ מסמכים בעברית וסביר שישבש את סדר הקריאה מימין לשמאל. בנוסף, יכולת איחוד הטבלאות שמתפרסות על פני כמה עמודים עדיין נמצאת בפיתוח לפי כרטיס המודל. קחו בחשבון שזהו כלי חילוץ בלבד ולא מודל שיחה שיודע לענות על שאלות חופשיות מתוך המסמך.

שאלות
נפוצות

האם המודל מתאים לחילוץ חשבוניות או מסמכים בעברית?

לא. המודל אומן והוגדר רשמית עבור אנגלית וסינית בלבד. עיבוד שפות שנכתבות מימין לשמאל לא נתמך ויגרום לשגיאות זיהוי קשות.

האם חייבים מאיץ גרפי חזק כדי להריץ אותו?

לא, המודל שוקל 2.2 גיגה בייט בלבד ומכיל 1.2 מיליארד פרמטרים. כל GPU צנוע עם 8 גיגה זיכרון יריץ אותו בצורה מקומית וחלקה.

איך מריצים

בגלל המשקל הקל, רק 2.2 גיגה בייט, אפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 6 או 8 גיגה בייט זיכרון. המפתחים מספקים ספריית פייתון ייעודית בשם mineru-vl-utils, ותומכים הן בהרצה סטנדרטית דרך transformers והן במנוע vLLM.

אם אתם מעבדים נפחים גדולים, מומלץ לעבוד ישירות עם vLLM ומנוע אסינכרוני, שמגיע למהירות של 2.12 פריימים לשנייה על מעבד A100 יחיד. אין סיבה אמיתית לשלם על API חיצוני כשאפשר להחזיק את המודל לוקאלית בעלויות שרת זניחות, אלא אם אין לכם גישה לשום GPU ואתם צריכים לנתח עמודים בודדים פעם בחודש.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="opendatalab/MinerU2.5-Pro-2604-1.2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או פתוחים, בתנאי ששומרים על הצהרת זכויות היוצרים והרישיון המקורי. אין כאן הגבלות מיוחדות על שימוש מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗