GPT
P

PP-DocLayoutV3

קוד פתוח

PaddlePaddleapache-2.02026-01-20

  • PaddleOCR
  • PaddlePaddle
  • image-segmentation
  • ocr
  • layout

הוא מנתח מבנה של מסמכים מקומטים, מעוקלים או מצולמים במסך במעבר חישובי בודד. במקום לחתוך מלבנים ישרים ולקוות לטוב, הוא מוציא פוליגונים עם סדר קריאה הגיוני.

  • 126 MBמשקל הקבצים
  • 21,963הורדות בחודש
  • 111לייקים

מה זה

ניתוח מבנה עמוד רגיל נשבר ברגע שהדף אינו שטוח לחלוטין. סורקים שולחניים מספקים תמונות מיושרות, אבל צילום מהיר בסמארטפון של חוזה מקומט, ספר פתוח עם דפים מעוקלים או תצלום של צג מחשב מייצרים עיוותים שמבלבלים מודלים סטנדרטיים. המודל הזה מתמקד בדיוק בנקודה הזו. הוא פותח כחלק מתשתית PaddleOCR ומשמש רכיב מפתח במערכות כמו PaddleOCR-VL 1.5 ו־GLM-OCR לצורך חילוץ מדויק של תוכן בעולם האמיתי.

ההבדל המרכזי מול מודלי סגמנטציה נפוצים הוא המעבר מתיבות תוחמות רגילות של שתי נקודות לתיבות מרובות נקודות שמגדירות פוליגונים גמישים. במקביל לזיהוי גבולות הפסקאות והאלמנטים הגרפיים, הוא חוזה ישירות את סדר הקריאה הנכון של הטקסט, גם כשהשורות עקומות או נטויות. ביצוע שתי הפעולות האלו יחד בריצה אחת מונע שרשור שגיאות, שבו חיתוך גיאומטרי שגוי הורס לחלוטין את פענוח הסדר הלוגי בשלבים הבאים.

מתאים ל

  • סריקת חוזים מקומטים

    זיהוי פסקאות מדויק בחוזים מצולמים מהשטח שאינם ישרים, תוך שמירה על רצף קריאה הגיוני.

  • דיגיטציה של ספרים עבים

    חילוץ טקסט מדפים מעוקלים סמוך לשדרת הספר בלי לאבד את סדר העמודות והטקסט.

  • עיבוד תצלומי מסך

    תיחום נתונים וטבלאות מתמונות שצולמו ישירות ממסכי מחשב בתנאי תאורה מורכבים.

איפה זה נופל

הכרטיס מציג הצלחה ויזואלית על מסמכים עם שינויי תאורה, עקמומיות, צילום מסך והטיות, אך אינו מפרט מדדי ביצועים כמותיים מספריים כמו דיוק חיתוך או זמני השריגות. בנוסף, מדובר במודל סגמנטציה וסדר קריאה בלבד. הוא אינו מבצע זיהוי תווים בפועל, כך שתצטרכו לחבר אותו למנוע OCR נפרד כדי לחלץ את הטקסט עצמו. נקודה נוספת לבדיקה מעשית היא התנהגות המודל מול גופנים עבריים וטקסט מימין לשמאל, שכן מודלים שפותחו מתוך סביבה אסייתית מתקשים לעיתים בהבנת כיווניות של שפות שמיות.

שאלות
נפוצות

האם המודל מוציא טקסט מוכן לקריאה?

לא. המודל מחזיר רק את מיקומי האלמנטים בעמוד באמצעות פוליגונים ואת סדר הקריאה ביניהם. כדי להפוך את האזורים הללו לטקסט חי, יש להזין את החיתוכים למודל OCR נוסף.

האם אני חייב להשתמש בספריית PaddlePaddle?

הקבצים במאגר הזה מיועדים ישירות ל־PaddlePaddle. עם זאת, היוצרים מציעים מאגר נפרד עם משקלי safetensors, המאפשרים טעינה קלה יותר בספריות פייתון אחרות.

איך מריצים

המשקל הכולל של הקבצים עומד על 126 מגה בייט בלבד, כך שניתן לפרוס אותו על כמעט כל מעבד מודרני בלי לחשוב פעמיים, ולנצל כרטיס גרפי צנוע לעיבוד מהיר יותר בתפוקה גבוהה. המאגר הזה מחזיק משקלים המותאמים לפריימוורק של PaddlePaddle, אך קיים מאגר מקביל עם קובצי safetensors למי שמעדיף סביבות עבודה אחרות.

בגודל כזה, פנייה לשירות ענן מרוחק לצורך חיתוך מקטעים היא פשוט בזבוז של זמני השהיה וכסף. אין צורך להעביר תמונות ברשת כשאפשר לארח את המודל ישירות על השרת המקומי או אפילו בקצה, כחלק מצינור עיבוד שלם יחד עם מנוע זיהוי תווים.

pip install -U huggingface_hub
hf download PaddlePaddle/PP-DocLayoutV3

הקבצים

5 קבצים במאגר, 126 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, הפצה, שינוי קוד ושילוב במוצרים סגורים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקוד המופץ, יחד עם ציון שינויים שבוצעו. אין חובה לפתוח את הקוד של המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗