GPT
Q

Qianfan-OCR

קוד פתוח

baiduapache-2.02026-03-18

  • transformers
  • safetensors
  • qianfan_ocr
  • image-text-to-text
  • vision-language

מודל ראייה ושפה קומפקטי שממיר מסמכים שלמים למרקדאון ומחלץ נתונים בלי שרשרת כלים מפוצלת. הוא מנצח במבחני פענוח מסמכים מודלים גדולים ממנו בהרבה.

  • 4.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 8.8 GBמשקל הקבצים
  • 178,807הורדות בחודש

מה זה

באידו בנו כאן מודל מקצה לקצה שמחבר מקודד תמונה מבוסס שנאי עם מודל שפה בגודל 3.6 מיליארד פרמטרים שאינם הטמעה. במקום לחבר כלי לזיהוי מבנה, כלי לקריאת טקסט ומודל שפה נפרד שמנסה להבין מה יצא, המערכת הזו מקבלת תמונה עד רזולוציה של 4K ומוציאה ישירות מרקדאון, טבלאות בפורמט HTML, נוסחאות בלאטך או מבני JSON לפי הנחיה.

החידוש העיקרי הוא מצב מחשבה ייעודי למבנה עמוד. כשתפעילו אותו, הוא מייצר תחילה תיבות תוחמות, סיווג של עשרים וחמישה רכיבים וסדר קריאה בתוך טוקנים מיוחדים, ורק אז פולט את התוכן. במבחן OmniDocBench v1.5 המודל הגיע לציון של 93.12, מעל DeepSeek-OCR-v2 וג'מיני 3 פרו. במבחני חילוץ מידע הוא השיג ממוצע של 87.9 ועקף מודלים עצומים כמו Qwen3-VL-235B.

מתאים ל

  • המרת מאמרים ודוחות

    הוא קורא נוסחאות בלאטך, טבלאות מורכבות ואיורים מורכבים ישירות למרקדאון נקי בלי לאבד את סדר הקריאה.

  • חילוץ שדות מחשבוניות

    המודל מוציא נתונים מקובצי תמונה ישירות למבנה JSON מוגדר מראש, עם ציונים מובילים במבחני KIE.

  • שאלות ותשובות מגרפים

    הוא מנתח מגמות ונתונים מתוך תרשימים ויזואליים שכלים רגילים זורקים החוצה בשלב הפשטת הטקסט.

איפה זה נופל

במסמכים פשוטים של עמודה אחת, הפעלת מצב המחשבה פוגעת בביצועים ומעלה את זמני הריצה סתם, כך שהיוצרים עצמם ממליצים לכבות אותו שם. בנוסף, זיהוי כתב יד נתמך רק בסינית ובאנגלית, למרות הצהרה כללית על תמיכה ב־192 שפות. אין שום תיעוד לביצועים בעברית, ולכן חובה לבדוק אותו מקומית על טקסט עברי לפני שבונים עליו. במבחני הבנת מסמכים רגילים כמו DocVQA הוא עדיין מפסיד ל־Qwen3-VL-4B.

שאלות
נפוצות

האם כדאי להפעיל את מצב המחשבה בכל ריצה?

לא. היוצרים ממליצים להפעיל אותו רק במסמכים מורכבים כמו עיתונים, מבחנים או דוחות עמוסי רכיבים. במסמכים פשוטים עם עמודה בודדת עדיף לכבות אותו כדי לחסוך זמן ריצה ולקבל תוצאות מדויקות יותר.

האם המודל יתמודד טוב עם מסמכים בעברית?

הכרטיס מצהיר על תמיכה ב־192 שפות כולל אלפבית לטיני, קירילי, ערבי ואסייתי, אך אינו מפרט מבחנים או תוצאות בעברית. בנוסף, זיהוי כתב יד מוגבל במפורש לאנגלית ולסינית בלבד. אם יש לכם צורך בעברית, תצטרכו להריץ עליה בדיקה מקומית כדי לוודא שסדר הקריאה והאותיות לא מתהפכים.

איך מריצים

במשקל של 8.8 גיגה בייט בדיוק bfloat16, המודל דורש כרטיס מסך בודד עם 16 עד 24 גיגה זיכרון כדי לעבוד בנוחות. בדיווח של באידו, הרצה שלו עם קוונטיזציה של W8A8 על כרטיס A100 מגיעה לקצב של קצת מעל עמוד בודד לשנייה, בעוד שבדיוק מלא הקצב צונח לחצי עמוד לשנייה.

אפשר להרים אותו מקומית דרך vLLM עם דריסה של הגדרת הארכיטקטורה, או להשתמש בספריית transformers הרגילה. אם יש לכם מסמכים בודדים מדי פעם, קריאה ל־API של שירות ענן תהיה זולה ופשוטה בהרבה מלהחזיק שרת ייעודי שדולק כל הזמן עבור קצב עיבוד כזה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="baidu/Qianfan-OCR")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא, כולל קבצי צד שלישי מסוימים שמופצים ברישיון MIT. המשמעות היא שאתם רשאים להריץ אותו, לשנות אותו, להטמיע אותו במוצרים מסחריים ולהפיץ אותו בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים את קובצי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗