GPT
P

PaddleOCR-VL

קוד פתוח

PaddlePaddleapache-2.02025-10-16

  • PaddleOCR
  • safetensors
  • paddleocr_vl
  • ERNIE4.5
  • PaddlePaddle

מודל ראייה ושפה קומפקטי במיוחד לפענוח מסמכים מורכבים. הוא שוקל פחות ממיליארד פרמטרים ומחלץ ישירות טקסט, טבלאות ונוסחאות.

  • 959Mפרמטרים
  • 131,072טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 9,599הורדות בחודש

מה זה

הארכיטקטורה מחברת מקודד ויזואלי ברזולוציה דינמית בסגנון NaViT יחד עם מודל שפה קטן מסוג ERNIE 4.5 0.3B. השילוב הזה מייצר מודל כולל של 959 מיליון פרמטרים, שמיועד לקריאת מסמכים שלמים בלי להזדקק לשרשרת כלים מפוצלת לזיהוי מיקום, קריאת טקסט ופענוח מבנה.

הוא מתמודד עם טבלאות ללא גבולות, תאים ממוזגים, נוסחאות מתמטיות בכתב יד וסריקות ישנות. במבחני OmniDocBench גרסאות 1.0 ו־1.5 המפתחים מדווחים על דיוק מוביל בקריאת סדר הפסקאות, חילוץ טבלאות ופענוח נוסחאות בהשוואה למודלים ייעודיים אחרים. בבדיקות הפנימיות שלהם על 11 סוגי תרשימים, כמו עמודות משולבות ועוגה, הוא מציג דיוק שעוקף מודלים כלליים גדולים בהרבה.

מתאים ל

  • המרת דוחות ל־Markdown

    מחלץ עמודים עמוסי מלל, שומר על סדר הקריאה ופולט קובץ נקי למערכות RAG.

  • סריקת מאמרים ונוסחאות

    מזהה משוואות מודפסות וכתובות יד מתוך סריקות ברזולוציה משתנה.

  • עיבוד טבלאות סבוכות

    ממיר תאים ממוזגים וטבלאות ללא קווי מתאר למבנה נתונים מוגדר היטב.

איפה זה נופל

ההבטחה לתמיכה ב־109 שפות כוללת בעיקר שפות מובילות כמו אנגלית, סינית, רוסית ותאילנדית. עברית לא מוזכרת בשום מקום בדוקומנטציה או בבנצ'מרקים, ולכן חובה לבדוק התנהגות עם כיווניות מימין לשמאל וגופנים מקומיים לפני שמסתמכים עליו. בנוסף, קיימת תלות בסביבת התוכנה הייעודית של Baidu כדי ליהנות מפענוח דפים שלם, ומי שמריץ דרך transformers הקלאסית מקבל בינתיים יכולת מנוונת של זיהוי מקטעים בלבד.

שאלות
נפוצות

האם הוא מזהה טקסט בעברית?

המודל מצהיר על תמיכה ב־109 שפות אך מפרט בעיקר אנגלית, סינית, ערבית ואחרות. עברית לא נבדקה ברשימות הביצועים הרשמיות, ולכן חובה להריץ בדיקה ידנית על מדגם מסמכים כדי לראות אם הוא מתמודד עם הכתב והכיווניות.

באיזו צורה עדיף להריץ אותו בקוד?

האפשרות המומלצת כרגע היא דרך תמונת השרת הרשמית של vLLM וספריית PaddleOCR. שימוש ישיר ב־transformers מספק כרגע זיהוי של חלקי תמונה בלבד ולא ניתוח מבני של דף שלם.

איך מריצים

המשקל הכולל יושב על כשני גיגהבייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגהבייט זיכרון יריץ אותו בקלות. יש תמיכה ישירה ב־vLLM עם תמונת דוקר מוכנה, וגם אפשרות לטעון אותו דרך transformers בשילוב flash-attn להאצת זמני התגובה.

מי שמתקין אותו מקומית דרך ספריית PaddleOCR מקבל צינור מלא שפולט קובצי JSON או Markdown. לעומת זאת, סקריפט הריצה הישיר של transformers מוגבל נכון לעכשיו לחילוץ ברמת האלמנט הבודד ולא מפענח דף מלא. שווה להרים שרת מקומי רק אם יש לכם נפח עבודה קבוע או דרישת פרטיות, אחרת קריאה ל־API חיצוני חוסכת את תחזוקת הסביבה של PaddlePaddle.

pip install -U huggingface_hub
hf download PaddlePaddle/PaddleOCR-VL

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה של המודל בחינם. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים וציון הרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗