GPT
P

PP-OCRv6_medium_det_safetensors

קוד פתוח

PaddlePaddleapache-2.02026-06-09

  • PaddleOCR
  • safetensors
  • pp_ocrv6_medium_det
  • OCR
  • PaddlePaddle

מודל ייעודי לאיתור מיקומי טקסט בתמונות, ששוקל עשרות מגה-בייטים בודדים. הוא מציע דיוק גבוה על מסמכים וטקסט מסובב בלי צורך להחזיק מודלי ראייה ענקיים.

  • 22Mפרמטרים
  • 84.0 MBמשקל הקבצים
  • 2,645הורדות בחודש
  • 132לייקים

מה זה

המודל הזה אחראי על שלב הגילוי, כלומר מציאת התיבות התוחמות של המלל בתמונה, ולא על קריאת התווים עצמם. המבנה שלו מבוסס על שלד LCNetV4 וצוואר RepLKFPN עם קונבולוציות מורחבות, שמתכנסים לצורה יעילה בזמן ריצה. החבילה כולה כוללת כ־22 מיליון פרמטרים במבנה קבצי safetensors של פייטורץ' וטרנספורמרס.

במדד Hmean הממוצע המודל מגיע ל־86.2%, שזה שיפור מורגש לעומת 81.6% של גרסת השרת מהדור הקודם. בבדיקות של טקסט מודפס באנגלית ובסינית הוא עובר 93%, וגם על טקסט מסובב הוא רושם 93.8%, תחום שבו מודלים ענקיים כמו GPT-5.5 ו־Qwen3-VL צונחים לתוצאות נמוכות בהרבה לפי נתוני הבדיקה. במילים פשוטות, הוא ממוקד במציאת המיקום הפיזי של השורות והאותיות בדיוק גבוה מאוד.

מתאים ל

  • חיתוך שורות במסמכים סרוקים

    איתור מדויק של שורות וטבלאות ברזולוציה גבוהה כשלב ראשון לפני זיהוי תווים.

  • זיהוי שלטים וטקסט מסובב

    מציאת תיבות טקסט בצילומים מהשטח שבהם הכתב נוטה בזוויות חדות, תחום שבו הוא מציג 93.8% דיוק.

  • עיבוד מקומי על חומרת קצה

    הרצה מקומית בתוך אפליקציות שולחניות או מערכות פנימיות שלא יכולות להוציא מידע לרשת.

איפה זה נופל

המודל הזה רק מאתר איפה יש טקסט, הוא לא קורא אותו. כדי להוציא מחרוזות צריך לחבר אליו מודל זיהוי נפרד. בטקסט אומנותי הוא יורד ל־69%, ובסביבות תעשייתיות כמו מספרי סידוריים על צמיגים הוא עומד על 73.3%, כך ששם יש פספוסים. בנוסף, המדדים הרשמיים מתמקדים בסינית ובאנגלית, ואין בנתונים שום התייחסות לעברית, כך שחייבים לבדוק עצמאית איך הוא מזהה גבולות של מילים מימין לשמאל לפני שמשלבים אותו במערכת מקומית.

שאלות
נפוצות

האם המודל מחזיר לי את המחרוזת של הטקסט שבתמונה?

לא. זהו מודל Detection בלבד, שמחזיר רק קואורדינטות של המיקומים שבהם מופיע כתב. כדי לפענח את התווים עצמם צריך להעביר את האזורים החתוכים למודל Recognition ייעודי בפייפליין.

מה ההבדל בין קובץ ה־safetensors הזה לגרסאות האחרות של המודל?

המשקולות נשמרות בפורמט safetensors המאובטח ומאפשרות טעינה קלה בסביבות פייתון מבוססות Hugging Face Transformers ו־PyTorch. המפרסמים מציעים גם גרסאות בפורמט Paddle המקורי ובפורמט ONNX שמתאים יותר למנועי הרצה מובנים.

איך מריצים

ההרצה נעשית ישירות דרך ספריית PaddleOCR בשילוב סביבת transformers ו־torch, כאשר מגדירים את המנוע כ־transformers. לא צריך שרת כבד או כרטיס מסך מפלצתי בשביל 84 מגה-בייט. מעבד סטנדרטי יספיק לרוב המשימות, וכרטיס מסך פשוט יריץ תמונות בזמן אפסי.

גרסת ה־safetensors הזו מתאימה למי שבונה פייפליין מבוסס פייתון ורוצה לטעון משקולות סטנדרטיות בלי תלות מלאה במנוע של פאדל בלבד. אם המוצר דורש רק גילוי טקסט על תמונות ספורות פעם בשעה, קריאה ל־API חיצוני תחסוך תחזוקה, אבל ברגע שיש נפח או רצון בעיבוד מקומי, להריץ אותו עצמאית זה זול ומהיר בהרבה.

pip install -U huggingface_hub
hf download PaddlePaddle/PP-OCRv6_medium_det_safetensors

הקבצים

6 קבצים במאגר, 84.0 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך תוכנה סגורה, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗