GPT
P

PaddleOCR-VL-1.6

קוד פתוח

PaddlePaddleapache-2.02026-05-27

  • PaddleOCR
  • safetensors
  • paddleocr_vl
  • ERNIE4.5
  • PaddlePaddle

מודל ראייה ושפה קומפקטי לפענוח מסמכים ששוקל פחות ממיליארד פרמטרים. הוא מיועד למי שרוצה לחלץ טבלאות, נוסחאות וטקסט בלי להחזיק כרטיסי מסך כבדים.

  • 959Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 33,185הורדות בחודש

מה זה

מדובר במודל image-text-to-text בגודל 959 מיליון פרמטרים שמתמחה בפירוק מסמכים מורכבים למבנה נקי. הוא מחלץ טקסט חופשי, נוסחאות מתמטיות, טבלאות, תרשימים וחותמות, תוך התמקדות בשיפור אזורים בעייתיים שזוהו בגרסאות קודמות. הארכיטקטורה שלו בנויה על 18 שכבות עם חלון הקשר עצום של 131,072 טוקנים, מה שמאפשר לעבד מסמכים ארוכים או מרובי פרטים בקריאה אחת.

במבחן OmniDocBench v1.6 הוא מציג דיוק כולל של 96.33 אחוז, ובמבחן Real5-OmniDocBench הוא מתמודד ישירות עם בעיות שטח נפוצות כמו עיוותי סריקה, זוויות צילום חדות, תאורה לקויה וצילומי מסך. המשמעות בפועל היא שהוא מגיע לרמת זיהוי של מודלים ענקיים בלי לדרוש תשתית שרתים יקרה ומסורבלת.

מתאים ל

  • חילוץ טבלאות ממסמכים

    ממיר טבלאות מצולמות ומסמכים סרוקים לקבצי json או markdown מסודרים.

  • המרה של נוסחאות מתמטיות

    מזהה משוואות ונוסחאות מתוך דפי מחקר ודוחות טכניים ברמת דיוק גבוהה.

  • עיבוד תמונות סרוקות פגומות

    שומר על יציבות זיהוי גם במסמכים שצולמו עקום, בתאורה ירודה או ממסך מחשב.

איפה זה נופל

למרות ההתקדמות בזיהוי תווים נדירים, המודל אומן בעיקר על אנגלית וסינית, כך שאין שום ערובה או תיעוד ביצועים עבור שפות שנכתבות מימין לשמאל כמו עברית. שימוש בסקריפט הסטנדרטי של transformers מוגבל לרמת האלמנטים הבודדים ולא נותן ניתוח מלא של עמוד שלם, מה שמחייב שימוש בספרייה הייעודית. מעבר לכך, התקנה על מחשבי מק דורשת שימוש מלא בדוקר ואינה נתמכת ישירות.

אותה משפחה

PaddleOCR-VL-1.6 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אני חייב להשתמש בפריימוורק של PaddlePaddle כדי להריץ את המודל?

לא חובה, אפשר לטעון אותו עם transformers החל מגרסה חמש לצורך זיהוי אלמנטים. עם זאת, פענוח מלא של מסמכים וטבלאות ברמת העמוד מחייב את התקנת PaddlePaddle בגרסה 3.2.1 ומעלה או הפעלת שרת מבוסס vLLM.

האם המודל יזהה טקסט בעברית מתוך תעודות ומסמכים?

התיעוד הרשמי מציין תמיכה באנגלית, סינית ושפות נוספות, אך כל המדדים והבדיקות מתמקדים בסינית ובאנגלית. עקב כך, סביר מאוד שהדיוק על עברית יהיה נמוך ומומלץ לבדוק דוגמאות בודדות לפני שמשלבים אותו במערכת.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.8 גיגה בייט בלבד בדיוק bfloat16, כך שכרטיס מסך ביתי פשוט עם מעט זיכרון מריץ אותו בלי בעיה. ההרצה השוטפת מתבצעת דרך ספריית PaddleOCR עם גרסת פריימוורק 3.2.1 ומעלה, או באמצעות שרת vLLM מוכן בקונטיינר docker להאצת קצב הקריאות בסביבת פרודקשן.

אפשר להריץ אותו גם ישירות דרך ספריית transformers החל מגרסה חמש עם flash-attention-2 לחסכון בזיכרון, אם כי היוצרים מציינים שהשיטה הזו תומכת בעיקר בזיהוי אלמנטים נקודתי. אם אתם צריכים רק לפרק עמוד בודד מדי פעם בלי לנהל תלויות של קודה, עדיף להשתמש בדמו המקוון של המפתחים.

pip install -U huggingface_hub
hf download PaddlePaddle/PaddleOCR-VL-1.6

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין לכל מטרה, כולל מוצרים מסחריים מסחריים ושינוי קוד המקור. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והודעת הרישיון המקורית בתוך ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗