GPT
F

Falcon-OCR

קוד פתוח

tiiuaeapache-2.02026-02-22

  • transformers
  • safetensors
  • falcon_ocr
  • text-generation
  • falcon

מודל זעיר לחילוץ טקסט שרץ בתוך טרנספורמר יחיד ומוציא טקסט, נוסחאות מתמטיות בלאטך או טבלאות קוד. הוא נועד למי שרוצה קצב עבודה גבוה בלי להחזיק שרתים כבדים.

  • 270Mפרמטרים
  • 8,192טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 4,691הורדות בחודש

מה זה

הארכיטקטורה כאן שונה מרוב מערכות הראייה המקבילות. במקום לחבר מקודד תמונה נפרד למפענח טקסט עם שכבות תיווך, המודל מעבד את פיסות התמונה ואת הטוקנים של הטקסט יחד באותו מרחב פרמטרים כבר מהשכבה הראשונה. תשומת הלב לתמונה היא דו כיוונית, והפענוח של הטקסט רץ בצורה סיבתית. הגישה הזו שומרת על ממשק פשוט שבו החלפת משימה נעשית דרך פרומפט שמבקש טקסט רגיל, טבלה או נוסחה.

במדד olmOCR הוא הגיע לציון ממוצע של 80.3 אחוז, תוך שהוא עוקף מערכות ענקיות כמו GPT 5.2 שהגיעה ל־69.8 וג׳מיני 3 פלאש שקיבלה 77.5. החוזק העיקרי שלו נמדד בטבלאות עם 90.3 אחוז ובמסמכים מרובי טורים עם 87.1 אחוז, שניהם המקומות הראשונים בבדיקה הזו. במדד OmniDocBench שמודד עיבוד עמוד מלא הוא השיג ציון כולל של 88.64, מעט מתחת למודלים ייעודיים כמו פאדל OCR שהוביל עם 94.37.

מתאים ל

  • המרת מאמרים אקדמיים

    הוא מזהה מבנה של טורים מקבילים בדיוק של 87.1 אחוז ומתרגם משוואות ישירות ללאטך.

  • עיבוד טבלאות ומסמכים עסקיים

    הוביל במבחן הטבלאות עם 90.3 אחוז וממיר נתונים ישירות לתגיות HTML שקל לנתח.

  • חילוץ טקסט מקומי בשרת פרטי

    משקל של גיגה בודד ודרישות חומרה נמוכות מאפשרים לפרוס אותו מקומית לשמירה על פרטיות.

איפה זה נופל

המודל מתקשה בסריקות ישנות וטקסט קטן במיוחד. במבחן הסריקות הישנות הוא קיבל 43.5 אחוז בלבד לעומת מודלים אחרים שהתקרבו לחמישים, ובטקסט זעיר עמד על 78.5 אחוז כשמתחרים עברו את התשעים. בנוסף, הוא רגיש לאופן שבו שפת הלאטך נבדקת, ומבנה ה־HTML של טבלאות זהות יכול להשתנות בין ריצות, עניין שעלול לשבור בדיקות אוטומטיות. אין בכרטיס שום מידע על תמיכה בשפות שאינן אנגלית או בעברית, ולכן חובה לבדוק אותו על מסמכים מקומיים לפני שמשלבים אותו בזרימת עבודה.

שאלות
נפוצות

האם המודל מתאים לקריאת מסמכים בעברית?

כרטיס המודל והמדדים לא מזכירים עברית כלל ומתמקדים באנגלית, נוסחאות וסריקות כלליות. מומלץ להריץ עליו כמה דוגמאות בדיקה בעברית לפני שמחליטים להשתמש בו לייצור.

מתי כדאי להשתמש במצב הרגיל ומתי בפייפליין המבנה?

למסמכים ישרים, קבלות, חשבוניות או שקופיות מספיקה קריאה פשוטה ישירות למודל. למסמכים מורכבים עם טורים, כותרות והערות שוליים עדיף להפעיל את הפייפליין המלא שגוזר אזורים לפני העיבוד.

האם חייבים שני כרטיסי מסך כדי להריץ את השרת?

לא. אפשר להריץ את שרת ה־vLLM ואת זיהוי המבנה על כרטיס בודד דרך הדוקר, אך צריך להגביל את הקצאת הזיכרון של vLLM ל־55 אחוז כדי לפנות מקום למודל המבנה.

איך מריצים

המשקל הכולל של הקבצים הוא גיגה בייט בודד, כך שכרטיס מסך בסיסי עם 8 או 16 גיגה זיכרון מריץ אותו בלי מאמץ בפורמט bfloat16. להרצה מקומית צריך פייתורץ' 2.5 ומעלה כדי לנצל את מנגנון FlexAttention. המפתחים מספקים קונטיינר דוקר מוכן שמריץ שרת vLLM לחילוץ הטקסט ומודל PP-DocLayoutV3 לזיהוי המבנה. בהגדרה של שני כרטיסים נפרדים, אחד לכל תהליך, אין תחרות על המשאבים.

בכרטיס A100 עם 80 גיגה המערכת הגיעה לקצב של 5,825 טוקנים לשנייה ו־2.9 תמונות לשנייה בפייפליין המלא. אם העומס שלכם הוא מסמכים ספורים בשבוע, התקנת סביבת דוקר עם שני כרטיסי מסך מיותרת ועדיף להשתמש ב־API מנוהל.

from transformers import pipeline

pipe = pipeline("image-to-text", model="tiiuae/Falcon-OCR")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחינם או כחלק ממוצר סגור, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗