GPT
P

PP-OCRv5_server_det

קוד פתוח

PaddlePaddleapache-2.02025-06-04

  • PaddleOCR
  • OCR
  • PaddlePaddle
  • textline_detection
  • image-to-text

זה מודל איתור טקסט בתמונות שמוצא איפה יושבות מילים, אפילו כשהן עקומות או בכתב יד. הוא לא קורא את התוכן בעצמו אלא רק מחזיר פוליגונים מדויקים.

  • 84.3 MBמשקל הקבצים
  • 753,011הורדות בחודש
  • 75לייקים

מה זה

המשקל הכולל של הקבצים עומד על 84.3 מגה בייט, שזה קומפקטי מאוד לשרתים שצריכים לסרוק כמויות של מסמכים בלי לחכות. הוא מיועד לזהות מיקומים של טקסט מודפס או כתוב ביד באנגלית, סינית ויפנית, ומתמודד עם סיבובים ועיוותים קשים בתמונה.

בבדיקות דיוק המודל מגיע ל־0.945 בטקסט מודפס בסינית ול־0.917 באנגלית, אבל התוצאות נחלשות כשהתנאים מסתבכים. בטקסט אומנותי הציון יורד ל־0.673, ובכתב עתיק או פיניין הוא נע סביב 0.67, כך שאם יש לכם לוגואים מורכבים או פונטים חריגים, הוא עלול לפספס גושי טקסט שלמים.

מתאים ל

  • חיתוך מסמכים סרוקים

    מוצא תיבות טקסט בדוחות ובטפסים כדי להעביר אותם למנוע תמלול מדויק.

  • זיהוי לוחיות רישוי

    מאתר מספרי רכב גם בזוויות צילום חדות ובסביבה עם עיוותים אופטיים.

  • איתור שלטים ברחוב

    מבודד כתובות ושלטי חוצות בתמונות חוץ שכוללות זוויות סיבוב ורקעים עמוסים.

איפה זה נופל

המודל הזה רק מאתר גבולות של טקסט ולא מחזיר מחרוזות קריאות, כך שחייבים לשרשר אותו למודל זיהוי נפרד כמו הגרסה המקבילה לזיהוי כדי לקבל תוצאות של ממש. בנוסף, המסמכים מציינים תמיכה באנגלית, סינית ויפנית בלבד. אין שום תיעוד או בדיקות על אותיות בעברית, ולכן חובה לבדוק ידנית אם הוא בכלל תוחם מילים מימין לשמאל לפני שבונים עליו משהו.

שאלות
נפוצות

האם המודל מוציא טקסט שאפשר להעתיק למסד נתונים?

לא. המודל מחזיר רק מערך קואורדינטות של פוליגונים שמסמנים איפה מופיע טקסט בתמונה, לצד ציון ודאות. כדי להמיר את האזורים האלה למילים אמיתיות, צריך לחבר אותו למודל זיהוי כמו PP-OCRv5_server_rec בתוך צינור עיבוד מלא.

האם הוא מתאים לזיהוי מסמכים בעברית?

התיעוד הרשמי מצהיר על תמיכה באנגלית, סינית ויפנית בלבד, בלי שום אזכור לעברית. ייתכן שהוא יזהה גושי טקסט עבריים פשוטים בתור צורות גיאומטריות, אבל אי אפשר להסתמך על זה בלי בדיקה מקדימה על הנתונים שלכם.

איך מריצים

מתקינים את חבילת paddleocr יחד עם גרסת paddlepaddle המתאימה, בין אם ל־CPU או לכרטיסי מסך עם CUDA 11.8 או 12.6. גודל של עשרות מגה בייטים בודדים אומר שאפשר להרים אותו בקלות על כל שרת בסיסי, ללא שום צורך במאיצים גרפיים יקרים.

הרצה מקומית עדיפה כשצריך עיבוד מהיר של תמונות בלי לשלם על כל קריאה לשרת חיצוני. צריך לשים לב שהוא דורש את סביבת PaddlePaddle של באידו, מה שמוסיף תלות כבדה לפרויקט אם שאר הקוד שלכם רץ ב־PyTorch.

pip install -U huggingface_hub
hf download PaddlePaddle/PP-OCRv5_server_det

הקבצים

6 קבצים במאגר, 84.3 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי קוד והפצה פנימית או בענן. אין חובה לחשוף קוד מקור סגור, אך נדרש לשמר את הודעות זכויות היוצרים והרישיון המקוריות של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗