GPT
F

FireRed-OCR

קוד פתוח

FireRedTeamapache-2.02026-02-28

  • safetensors
  • qwen3_vl
  • image-to-text
  • eval-results

המודל הזה לוקח תמונות של מסמכים מורכבים וממיר אותן ישירות למרקדאון עם טבלאות ונוסחאות סגורות היטב. מי שרוצה דיוק מבני מקצה לקצה בלי שרשרת כלים כבדה ימצא בו פתרון קומפקטי.

  • 2.1Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.0 GBמשקל הקבצים
  • 1,197הורדות בחודש

מה זה

מדובר במודל ראייה שפה בגודל 2.1 מיליארד פרמטרים שמבוסס על הארכיטקטורה של Qwen3-VL ועבר אימון ייעודי לפירוק מסמכים. במקום לזהות רק טקסט שטוח, הוא משתמש בלמידת חיזוק כדי לאכוף תקינות תחבירית, מה שמונע ממנו לפלוט טבלאות פרוצות או נוסחאות LaTeX שבורות שאי אפשר לקמפל אחר כך.

במבחן OmniDocBench v1.5 הוא מגיע לציון כולל של 92.94, מעל DeepSeek-OCR 2 ומעל מודלי ענק כלליים. המשמעות בפועל היא שהוא שומר על סדר הקריאה ומבנה העמוד ברמה גבוהה מאוד ביחס למודל יחיד, בלי להזדקק למודלים נפרדים לזיהוי מקטעים וטבלאות.

מתאים ל

  • המרת מאמרים אקדמיים

    שומר על נוסחאות מתמטיות בפורמט LaTeX תקין וסדר קריאה נכון של עמודות כפולות.

  • חילוץ טבלאות מורכבות

    מייצר קוד מרקדאון של טבלאות עם תאים סגורים היטב ישירות מדוחות פיננסיים.

  • עיבוד מסמכים מקומי בשרת קטן

    רץ ביעילות על כרטיס מסך פשוט בזכות משקל קל של 2.1 מיליארד פרמטרים.

איפה זה נופל

במסמכים אמיתיים ומבולגנים שנבדקו ב־FireRedBench הציון שלו יורד ל־74.62, מה שאומר שבמקרים חריגים של עמודים עקומים או פריסות צפופות הוא עדיין יטעה. בנוסף, התיעוד מציג רק מדדים באנגלית וסינית ולא מזכיר עברית כלל, לכן סביר מאוד שכיווניות מימין לשמאל ומסמכים מעורבים בעברית ידרשו בדיקה קפדנית לפני שתסמכו עליו.

שאלות
נפוצות

האם המודל יודע לקרוא מסמכים בעברית?

כרטיס המודל לא מדווח על תמיכה בעברית ומציג מבחנים בסינית ובאנגלית בלבד. הארכיטקטורה אמנם תומכת בתווי יוניקוד, אך נדרש מבחן מעשי על מסמכים מקומיים כדי לראות אם הוא לא הופך את כיוון הטקסט.

האם צריך רכיבי OCR נוספים כמו זיהוי פריסה לצדו?

לא, המודל פועל מקצה לקצה ומקבל את התמונה ישירות. הוא מחזיר את המרקדאון המובנה בלי צורך במודלים מקדימים לאיתור תיבות טקסט.

איך מריצים

במשקל של 4 גיגה בייט, המודל הזה רץ בקלות על כרטיס מסך בודד ברמת כניסה עם 8 עד 12 גיגה בייט של זיכרון גרפי, תלוי ברמת הקוונטיזציה. הרצה מקומית מתבצעת ישירות דרך ספריית transformers ו־qwen-vl-utils בפייתון בלי להסתבך עם סביבות מורכבות.

אם אתם צריכים לפרק כמה מסמכים ביום בלבד, עדיף להשתמש ב־API חיצוני כדי לחסוך תחזוקת שרת. לעומת זאת, אם יש לכם זרימת מסמכים קבועה או דרישה שהמידע לא ייצא מהרשת הפנימית, הגודל הזה הופך אותו למועמד זול מאוד לתפעול עצמי.

pip install -U huggingface_hub
hf download FireRedTeam/FireRed-OCR

הרישיון

המודל והקוד מופצים תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בחינם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת שיתוף של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗