GPT
O

OCRFlux-3B

קוד פתוח

ChatDOCרישיון לא דווח2025-06-12

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • conversational

מודל ראייה קומפקטי שממיר קובצי מסמכים ותמונות לטקסט מרקדאון נקי. מי שיבחר בו מחפש דיוק גבוה בטבלאות וחיבור רציף של אלמנטים שנחתכו בין עמודים, בלי להחזיק שרת יקר.

  • 4.1Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.6 GBמשקל הקבצים
  • 1,035הורדות בחודש

מה זה

מדובר בהתאמה ממוקדת של Qwen2.5-VL לגודל של 4.1 מיליארד פרמטרים, שאומנה על נתונים פרטיים של ChatDOC וחלק ממאגר olmOCR. ייעודו המרכזי הוא פירוק מסמכים סרוקים או קובצי PDF והפקת פלט במבנה מרקדאון, כולל זיהוי של פסקאות וטבלאות. היתרון הייחודי שהוא מציג הוא אלגוריתם מובנה לחיבור ישויות שנשברות במעבר בין עמודים עוקבים, תכונה שלרוב נשברת לחלוטין בכלים מתחרים.

במבחני ביצועים של החברה על דפים בודדים, הוא מציג דיוק עריכה ממוצע של 0.967 באנגלית ובסינית, נתון שעוקף מודלים גדולים יותר כמו olmOCR-7B. בטבלאות פשוטות הוא מגיע לציון דמיון מבני של 0.912, אך בטבלאות מורכבות שמכילות תאים מפוצלים וממוזגים הוא משיג 0.807, שזה פחות מהתוצאה של MonkeyOCR באותה קטגוריה.

מתאים ל

  • חילוץ טבלאות ממסמכים

    ממיר טבלאות מפוצלות בין עמודים לקוד HTML מאוחד ברמת דיוק גבוהה של 0.950 במדד TEDS.

  • הזנת מסמכים למאגרי RAG

    מייצר פלט מרקדאון נקי ששומר על פסקאות רציפות גם כשהן נחתכות בסוף עמוד, מה שמבטיח חיתוך טקסט תקין.

  • עיבוד מקומי של מסמכים באנגלית

    מאפשר פענוח קבצים רגישים בתוך הרשת המקומית על גבי כרטיס RTX 3090 בודד, בלי להוציא מידע לענן.

איפה זה נופל

המודל מוגדר רשמית רק לאנגלית וסינית, ואין בו שום תמיכה מוצהרת בעברית או בשפות שנכתבות מימין לשמאל. אם תזינו לו מסמכים בעברית, סביר שתקבלו ג׳יבריש או טקסט הפוך לחלוטין. בנוסף, מדובר בגרסת preview מוקדמת, ובטבלאות מורכבות עם תאי רשת חופפים הדיוק שלו צונח ומפסיד לכלים ייעודיים אחרים. חובה לבדוק אותו על סריקות עקומות ומסמכים מטושטשים משלכם לפני שמבססים עליו קו ייצור.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחילוץ חוזים וחשבוניות בעברית?

לא מומלץ. המודל אומן ותועד רק עבור אנגלית וסינית, ובלי אימון מפורש על מסמכים מימין לשמאל הוא ייכשל בפענוח אותיות וסדר המילים.

מה החומרה המינימלית שנחוצה כדי לעבד קבצים בקצב סביר?

כרטיס מסך בודד של 24 גיגה-בייט, כמו Nvidia RTX 3090, מספיק בהחלט. המודל שוקל 7.6 גיגה-בייט והרצה דרך vLLM מנצלת את הזיכרון הזה ביעילות גבוהה.

האם מותר להטמיע אותו במוצר מסחרי שמשרת לקוחות?

כרגע לא כדאי. היוצרים לא סיפקו שום רישיון שימוש, וללא היתר מפורש אתם חשופים להפרת זכויות יוצרים אם תשלבו אותו בשירות בתשלום.

איך מריצים

מריצים אותו מקומית באמצעות ספריית vLLM דרך קוד פייתון ישיר או בקונטיינר דוקר רשמי שמספקת החברה. עם משקל קבצים של 7.6 גיגה-בייט ודיוק bfloat16, המודל נכנס בנוחות לכרטיס מסך בודד ברמת צרכן כמו Nvidia RTX 3090, בלי צורך בשרתי עיבוד מרובי כרטיסים.

כדי לעבד כמויות גדולות כדאי להשתמש בסקריפט ה־pipeline של הפרויקט שמטפל בתור הקבצים ומייצר פלט jsonl שמומר למרקדאון. אם אין לכם כרטיס מתאים עם לפחות 24 גיגה-בייט זיכרון גרפי או שאתם צריכים לפענח רק מסמך מזדמן פעם בחודש, עדיף להשתמש בדמו המקוון של החברה ולא להסתבך עם התקנת סביבת דוקר ודרייברים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ChatDOC/OCRFlux-3B")
print(pipe("שלום"))

הרישיון

היוצרים לא ציינו רישיון שימוש בקבצי המודל. מצב כזה אומר שמבחינה משפטית כל הזכויות שמורות להם, ואין היתר מפורש להשתמש בו במוצר מסחרי, להפיץ אותו מחדש או לשלב אותו במערכות פנימיות של חברה. כל עוד הם לא מעדכנים רישיון קוד פתוח ברור, השימוש בו כרוך בסיכון משפטי ישיר.

הרישיון המלא בעמוד המודל ↗