GPT
I

Infinity-Parser2-Pro

קוד פתוח

inflyapache-2.02026-04-08

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • ocr

מודל ראייה ושפה שממיר מסמכים, טבלאות ונוסחאות למרקדאון או ג'ייסון עם תיבות תוחמות. הוא מיועד למי שצריך דיוק גבוה בהבנת מבנה של מסמכים מורכבים במקום סתם לחלץ טקסט גולמי.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 65.4 GBמשקל הקבצים
  • 245,078הורדות בחודש

מה זה

המודל הזה בנוי על ארכיטקטורת MoE של Qwen3.5 עם 35 מיליארד פרמטרים, והוא מתמקד בעיבוד מסמכים סרוקים או דיגיטליים. מעבר לחילוץ טקסט רגיל, המטרה שלו היא לשמר את המבנה המדויק של הדף, כולל סדר קריאה בטורים, נוסחאות מתמטיות, מבנים כימיים ותרשימים שהופכים ישירות לטבלאות או לקובצי מבנה. הוא מציע שני סוגי פלט עיקריים: המרה ישירה למרקדאון נקי או ייצוא ג'ייסון מפורט שמכיל קואורדינטות מיקום לכל רכיב בעמוד.

במבחני הביצועים של מסמכים כמו olmOCR-Bench ו־ParseBench הוא מוביל על פני חלופות כמו MinerU2.5 ו־DeepSeek-OCR-2, עם תוצאות של 87.6% ו־74.3% בהתאמה. המשמעות בפועל היא פחות הזיות בטבלאות רחבות ללא קווי מתאר והבנה טובה בהרבה של עמודים עמוסים כמו מאמרים אקדמיים או דוחות פיננסיים. יחד עם זאת, במבחני הבנה מולטימודלית כלליים כמו MathVista או AI2D הוא מפגר אחרי מודלים ייעודיים רחבים יותר כמו Gemini-3-Pro, כך שהכוח העיקרי שלו נשאר בניתוח מסמכים ממוקד.

מתאים ל

  • פיענוח מאמרים ודוחות

    ממיר טורים צפופים, נוסחאות מתמטיות מורכבות ומבנים אקדמיים ישירות לפורמט מרקדאון תקני.

  • חילוץ טבלאות פיננסיות

    מזהה יישור שורות ומבנה תאים בטבלאות רחבות ללא קווי גבול מדוחות כספיים ומייצא אותן כטבלה.

  • שחזור מבנה עם מיקומים

    מפיק קובץ ג'ייסון עם קואורדינטות מדויקות לכל פסקה ואלמנט בעמוד לצורך ציון מקורות במערכות חיפוש.

איפה זה נופל

המודל מוגדר בעיקר לאנגלית וסינית, וביצועיו נשחקים ברגע שמכניסים מסמכים בשפות אחרות. עבור טקסט בעברית, סביר מאוד שתיתקלו בשגיאות פיענוח או בעיות בסדר הקריאה. בנוסף, הוא מתקשה בניתוח גרפים מורכבים מאוד ובמסמכים עם אלמנטים מסובבים כמו טבלאות בזוויות לא שגרתיות. הוא גם מתעלם מעיצוב טקסט בסיסי כמו הדגשות או נטוי, ואינו מצטיין במעקב אחרי הנחיות מולטימודליות מורכבות בשלבים מרובים.

שאלות
נפוצות

האם המודל עובד טוב על מסמכים בעברית?

התיעוד מציין במפורש שהאימון התמקד באנגלית ובסינית, וכי הביצועים יורדים בשפות אחרות. לא מומלץ להסתמך עליו לעיבוד עברית בלי לבדוק דוגמאות מייצגות קודם.

אפשר להריץ אותו על מחשב נייד או כרטיס בודד רגיל?

לא. מדובר במודל ששוקל מעל 65 גיגה-בייט ודורש תצורת שרת עם שני כרטיסי מסך תעשייתיים כדי לפעול דרך vLLM באופן תקין.

מה ההבדל בין פלט doc2json ל־doc2md בספרייה שלו?

doc2md מחלץ את הטקסט וממיר אותו ישירות למסמך קריא, בעוד ש־doc2json מספק את המיקומים של כל אובייקט בעמוד לצורך עיבוד תוכנתי המשכי.

איך מריצים

כדי להריץ אותו מקומית צריך מערך חומרה כבד. קובצי המודל תופסים 65.4 גיגה-בייט, וכדי לטעון אותו עם vLLM או ספריית transformers בפורמט bfloat16 תידרשו לפחות לשני כרטיסי GPU של 80 גיגה-בייט עם חלוקת עומס. פקודת השרת המוצעת מגדירה במפורש מקביליות של שני מעבדים גרפיים ושימוש ב־85% מזיכרון הווידאו.

המפתחים הוציאו גם גרסת Flash שמיועדת למהירות גבוהה פי 3.68 על חשבון דיוק. אם אין לכם תשתיות שרתים פנימיות עם חומרה ברמה הזו, או שאתם מעבדים נפחים קטנים בלבד, להרים שרת ייעודי למודל של 35 מיליארד פרמטרים יעלה הרבה יותר משימוש בשירות חיצוני קיים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="infly/Infinity-Parser2-Pro")
print(pipe("שלום"))

הרישיון

הפרויקט משוחרר תחת רישיון Apache 2.0 המלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהטמיע אותו במוצרים פנימיים או חיצוניים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗