GPT
P

PaddleOCR-VL-1.5

קוד פתוח

PaddlePaddleapache-2.02026-01-28

  • PaddleOCR
  • safetensors
  • paddleocr_vl
  • ERNIE4.5
  • PaddlePaddle

מודל חזותי קומפקטי של 0.9B פרמטרים לפיענוח מסמכים מורכבים. הוא מתמחה בצילומי שטח עקומים, זיהוי חותמות, מיזוג טבלאות בין עמודים וטקסטים עם נוסחאות.

  • 959Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 15,700הורדות בחודש

מה זה

המודל הזה לוקח משימות ראייה וטקסט ומצמצם אותן ל־959 מיליון פרמטרים בלבד, עם חלון הקשר של 131,072 טוקנים. במקום לעבוד רק על מסמכים סרוקים ישרים, הוא כולל מנגנון לזיהוי פוליגונים לא רגולריים, מה שמאפשר לו לחלץ תוכן מדפים מקומטים, צילומים מזוויות חדות או תמונות מסך עם תאורה לקויה.

לפי נתוני הבדיקה בכרטיס, הוא מגיע לדיוק של 94.5% ב־OmniDocBench v1.5 ומציג תוצאות גבוהות במבחן Real5 שבודק סריקות פגומות, עיוותים וצילום ממסכים. חוץ מטקסט רץ, הוא מטפל בנוסחאות, מזהה חותמות רשמיות, תומך בבנגלי וטיבטי, ויודע למזג כותרות וטבלאות שנמתחות על פני כמה עמודים לקובץ פלט רציף במרקדאון או JSON.

מתאים ל

  • פיענוח מסמכים ומסמכי חשבון

    מזהה טבלאות מורכבות וממזג אותן גם כשהן נמשכות לאורך כמה עמודים רצופים.

  • חילוץ מידע מצילומי שטח

    מתמודד עם ניירות מקומטים, תאורה לקויה וזוויות צילום עקומות בזכות זיהוי פוליגונים.

  • זיהוי חוזים וחותמות

    מאתר ומפענח חותמות רשמיות וטקסטים מסומנים ישירות מתוך סריקות של חוזים.

איפה זה נופל

למרות שהוא מוגדר כמולטילינגואלי, אין בכרטיס שום אינדיקציה רשמית לתמיכה בעברית או יישור מימין לשמאל, מה שמחייב אתכם לבדוק אותו עצמאית לפני כל שימוש מקומי. בנוסף, חלוקת העבודה בעייתית: ההרצה ב־transformers מוגבלת רק לאלמנטים בודדים, ומי שרוצה ניתוח עמוד שלם עם טבלאות נאלץ להתקין את כל האקוסיסטם הכבד של PaddlePaddle או להרים קונטיינר של vLLM. הכרטיס גם לא מפרט ביצועים על כתב יד חופשי.

אותה משפחה

PaddleOCR-VL-1.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על מעבד בלי כרטיס מסך ייעודי?

בזכות גודל של 0.9B ומשקל של 1.8 גיגה בייט, אפשר עקרונית להריץ אותו על מעבד באמצעות llama.cpp או גרסת CPU של הספריות. עם זאת, ניתוח קבצי PDF ארוכים בקצב סביר ידרוש כרטיס מסך ייעודי.

האם המודל יודע לנתח מסמכים בעברית?

הכרטיס מציין אנגלית, סינית, שפות מרובות והרחבה לטיבטית ובנגלי, אך עברית אינה מוזכרת במפורש. מומלץ להריץ עליו דוגמה של מסמך מקומי כדי לבדוק סדר מילים ואותיות לפני שמתבססים עליו במוצר.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.8 גיגה בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 8 עד 16 גיגה זיכרון מריץ אותו בלי בעיה. ההרצה הרשמית של הפייפליין המלא דורשת את חבילות paddlepaddle-gpu ו־paddleocr, או שרת מבוסס vLLM בדוקר שהמפתחים מספקים.

מי שרוצה הרצה קלה בלי כל התשתית של PaddlePaddle יכול להשתמש ב־llama.cpp דרך קובצי GGUF, או בגרסת transformers v5. שימו לב שב־transformers המודל תומך רק בזיהוי אלמנטים בסיסי ולא בעיבוד פריסה מלא של עמודים שלמים.

pip install -U huggingface_hub
hf download PaddlePaddle/PaddleOCR-VL-1.5

הרישיון

רישיון apache-2.0 מלא. אתם רשאים להריץ את המודל, לשנות את הקוד שלו ולשלב אותו במוצרים מסחריים ללא תשלום תמלוגים, בתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗