GPT
M

MinerU2.5-2509-1.2B

קוד פתוח

opendatalabagpl-3.02025-09-17

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • conversational

מודל קטן של 1.2 מיליארד פרמטרים שממיר מסמכים ותמונות לקוד מרקדאון מסודר. הוא מתאים למי שרוצה פיענוח מהיר של טבלאות ומשוואות מתמטיות מורכבות בלי להחזיק שרתים כבדים.

  • 1.2Bפרמטרים
  • 16,384טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 40,252הורדות בחודש

מה זה

מדובר במודל ראייה ושפה שמבוסס על הארכיטקטורה של Qwen2-VL, אבל מאומן למטרה אחת בלבד, פירוק מסמכים סרוקים וקבצי תמונה למבנה דיגיטלי. במקום להסתכל על כל הדף ברזולוציה ענקית ולשרוף משאבים, הוא עובד בשני שלבים. קודם הוא מנתח את הפריסה הכללית על תמונה מוקטנת, ורק אז ניגש ברזולוציה המקורית לאזורים הספציפיים שמכילים טקסט, טבלאות או נוסחאות.

הגישה הזו מייצרת איזון טוב בין דיוק לעומס חישובי. המודל מתמחה בזיהוי אלמנטים שלרוב שוברים מנועי פיענוח רגילים, כמו טבלאות מסובבות, טבלאות בלי גבולות ברורים, ונוסחאות שמשלבות אנגלית וסינית ביחד. הוא מחלץ גם פרטים קטנים מסביב כמו כותרות עליונות, מספרי עמודים, רשימות ובלוקים של קוד, כדי לשמור על רצף המסמך המקורי.

מתאים ל

  • פיענוח מאמרים מדעיים

    הוא קורא משוואות מתמטיות ארוכות ומורכבות וממיר אותן למבנה מסודר.

  • הזנת מסמכים לצינור RAG

    מחלץ טקסט עם כותרות, טבלאות ובלוקים של קוד בצורה מדויקת לאנגלית.

  • חילוץ טבלאות ללא גבולות

    מזהה מבנה נתונים של טבלאות מסובבות או פתוחות שקוראות OCR רגילות מפספסות.

איפה זה נופל

המודל הוכשר ספציפית על אנגלית וסינית. הוא לא מיועד לשפות אחרות, כך שאם המסמכים שלכם מכילים עברית, אל תצפו לפיענוח אמין של הטקסט. נוסף על כך, תהליך העבודה הדו שלבי דורש ספריות עזר ייעודיות להתממשקות ולא מסתכם בקריאה פשוטה למודל גנרי. למרות שהוא קל משקל, הקצב שדווח על חומרה חזקה כמו A100 עומד על כשני עמודים בלבד לשנייה, כך שמי שבונה על סריקה המונית יצטרך להשקיע בחומרה מתאימה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לסריקת מסמכים בעברית?

לא. המודל אומן ותומך רשמית רק באנגלית ובסינית. הוא לא מיועד לפיענוח של עברית ולא כדאי להסתמך עליו בטקסט מקומי.

איזה כרטיס מסך צריך בשביל להריץ אותו אצלי?

המודל שוקל 2.2 גיגה בייט בלבד, כך שכל כרטיס מודרני עם זיכרון גרפי צנוע יספיק לטעינה שלו. יחד עם זאת, אם רוצים קצב עיבוד סביר של כשני עמודים בשנייה, נדרש מאיץ חזק ברמה של A100.

האם כדאי לשלב אותו במוצר ענן מסחרי סגור?

לא כדאי בלי ייעוץ משפטי. רישיון agpl-3.0 דורש לחשוף את קוד המקור של היישום שמספק את השירות אם משתמשים ניגשים אליו דרך הרשת.

איך מריצים

בגודל של 1.2 מיליארד פרמטרים ומשקל קבצים של 2.2 גיגה בייט, המודל הזה רץ בקלות על כרטיסי מסך צנועים עם מעט זיכרון. מריצים אותו בעזרת הספרייה הייעודית mineru-vl-utils, כאשר התמיכה כוללת את transformers וגם את vLLM. המפתחים מדווחים שגרסת השרת של vLLM מגיעה לקצב של 2.12 פריימים לשנייה על מאיץ A100 בודד.

מי שלא רוצה לתחזק שרת משלו יכול להשתמש בשירות הענן שלהם דרך ממשק פייתון, שכולל מסלול חינמי למסמכים קצרים עד 20 עמודים או 10 מגה בייט. אם יש לכם צורך בעיבוד פנימי או כמויות גדולות, הרצה עצמאית היא הדרך הנכונה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="opendatalab/MinerU2.5-2509-1.2B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון agpl-3.0. מותר להשתמש בו לצרכים מסחריים, אבל הרישיון הזה מאוד מגביל מוצרים מסחריים. אם אתם מריצים אותו ומציעים שירות מבוסס רשת למשתמשים, אתם מחויבים לפי תנאי הרישיון לפתוח את כל קוד המקור של המערכת שמסביבו לציבור.

הרישיון המלא בעמוד המודל ↗