GPT
P

PP-DocLayoutV3_safetensors

קוד פתוח

PaddlePaddleapache-2.02026-01-20

  • transformers
  • safetensors
  • pp_doclayout_v3
  • object-detection
  • PaddleOCR

זיהוי מבנה עמוד למסמכים עקומים או מקומטים. הוא מחזיר פוליגונים וסדר קריאה במעבר יחיד, בלי להסתמך על מלבנים ישרים.

  • 33Mפרמטרים
  • 127 MBמשקל הקבצים
  • 944,754הורדות בחודש
  • 39לייקים

מה זה

המודל הזה משמש כרכיב ניתוח המבנה בתוך מערכות כמו PaddleOCR-VL 1.5, GLM-OCR ו־PaddleOCR-VL 1.6. במקום להניח שכל מסמך הוא דף סרוק וישר, הוא מזהה אלמנטים על גבי משטחים לא ישרים, דפים מעוקלים, צילומים של מסכים וניירות עם תאורה לא אחידה. התוצאה שלו כוללת תיחום מרובה נקודות ולא רק מלבן של שתי נקודות.

בגודל של 33 מיליון פרמטרים בלבד, הוא קטן בהרבה מפתרונות מבוססי מודלי שפה ויזואליים כבדים. הוא פותר שתי בעיות בריצה בודדת: הוא מוצא את חלקי המסמך וקובע את סדר הקריאה הלוגי ביניהם. השילוב הזה בפעימה אחת מונע שרשור שגיאות, שבו טעות בתיחום הראשוני הורסת את פענוח הסדר בהמשך.

מתאים ל

  • חיתוך קבלות מצולמות

    זיהוי אזורי טקסט בקבלות עקומות או מקומטות מסמארטפון, בזכות תיחום מרובה נקודות שמתאים למשטח לא ישר.

  • סדר קריאה לספרים סרוקים

    קביעת סדר קריאה תקין בעמודים מעוקלים של ספרים פתוחים ישירות במעבר אחד, כהכנה למנוע זיהוי תווים.

  • ניתוח צילומי מסך של דוחות

    בידוד טבלאות ופסקאות מתוך תמונות מסך שסובלות מבוהק או תאורה בעייתית, בלי צורך במודל ויזואלי כבד.

איפה זה נופל

המודל הזה רק מנתח את מבנה העמוד ומזהה מיקומים וסדר. הוא לא מבצע OCR בעצמו, לא מחלץ טקסט ולא קורא את התוכן של הפוליגונים שהוא מסמן. תידרשו להריץ מודל טקסט נפרד על החיתוכים שהוא מייצר.

בנוסף, הכרטיס אינו כולל מדדי ביצועים מדויקים כמו mAP או זמני ריצה במילישניות, אלא רק דוגמאות ויזואליות להתמודדות עם קיעור וזווית. שפות המודל מוגדרות כאנגלית, סינית ורב-לשוני, אך אין פירוט לגבי התנהגות עם עברית או כיווניות מימין לשמאל, ולכן חובה לבדוק ידנית אם סדר הקריאה המוצע נשמר כהלכה במסמכים מקומיים.

שאלות
נפוצות

האם המודל הזה מוציא טקסט מקובץ התמונה?

לא. המודל מחזיר אך ורק זיהוי אובייקטים, כלומר את הפוליגונים שמקיפים את האלמנטים בעמוד ואת סדר הקריאה שלהם. כדי לקבל את הטקסט עצמו, עליכם להעביר את האזורים המזוהים למודל OCR ייעודי.

האם הוא מתאים לעבודה עם עברית?

המודל מתויג כרב-לשוני, אבל הוא אומן בעיקר סביב פרויקטים בסינית ובאנגלית. מאחר שהוא מנתח גיאומטריה ומבנה ולא קורא תווים, הוא יזהה את הגושים, אך יש לבדוק האם סדר הקריאה נקבע מימין לשמאל או משמאל לימין.

איך מריצים

המשקל הכולל של הקבצים עומד על 127 מגה בייט בפורמט safetensors, ונטען ישירות דרך ספריית transformers בארכיטקטורת PPDocLayoutV3ForObjectDetection. עם 33 מיליון פרמטרים בדיוק float32, אין שום סיבה לקרוא ל־API חיצוני. אפשר להריץ אותו מקומית על מעבד רגיל לחלוטין או על GPU זול וישן בלי לחשוב פעמיים.

הגרסה הזו מכילה משקלי safetensors עבור transformers, בעוד שהמשקלים המקוריים של PaddlePaddle יושבים במאגר נפרד. אם כל מה שאתם צריכים זה לזהות מקטעים וסדר קריאה כשלב מקדים ל־OCR, הריצה המקומית מיידית וחוסכת עלויות תעבורה.

from transformers import pipeline

pipe = pipeline("object-detection", model="PaddlePaddle/PP-DocLayoutV3_safetensors")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 127 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים. התנאי המרכזי הוא שמירה על הצהרת זכויות היוצרים ועותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗