GPT
P

PaddleOCR-VL-For-Manga

קוד פתוח

jzhang533apache-2.02025-11-05

  • PaddleOCR
  • safetensors
  • paddleocr_vl
  • OCR
  • Manga

מודל ראייה קומפקטי שמחלץ טקסט יפני מבועות דיבור ומפונטים מסוגננים במנגה. הוא נותן פתרון מקומי מדויק לקטעי תמונות שרוב כלי הראייה הכלליים מפספסים לחלוטין.

  • 959Mפרמטרים
  • 131,072טוקנים בהקשר
  • 1.8 GBמשקל הקבצים
  • 833הורדות בחודש

מה זה

מדובר בהתאמה ייעודית של PaddleOCR-VL למשימה ספציפית: זיהוי טקסט בקומיקס יפני. המפתח אימן אותו על בסיס נתונים של מאה אלף חיתוכי טקסט מתוך Manga109-s ועוד מיליון וחצי דוגמאות סינתטיות. המטרה כאן היא להתמודד עם טיפוגרפיה ידנית, פונטים מוגזמים, וטקסט שיושב ישירות על ציורים ולא על רקע נקי של מסמך משרדי.

במבחן התוצאה על חיתוכי מנגה, המודל מגיע לשבעים אחוזי דיוק ברמת המשפט המלא, לעומת עשרים ושבעה אחוזים בלבד של מודל הבסיס. הפער הזה ממחיש כמה מודלים כלליים מתקשים עם סגנון חופשי ביפנית. הפלט מיועד לחיתוכים בודדים ולא לעמודים שלמים, כך שנדרש שלב מקדים שיחתוך את בועות הדיבור לפני שהן נשלחות אליו.

מתאים ל

  • חילוץ טקסט מבועות דיבור

    זיהוי יפנית מתוך חיתוכים ממוקדים של בועות קומיקס בדיוק גבוה בהרבה ממודלי ראייה כלליים.

  • פייפליין מקומי לתרגום מנגה

    שילוב בתוך מערכת תרגום פרטית שרצה אופליין בלי לשלוח תמונות לשרתים חיצוניים.

  • אינדוקס מאגרי קומיקס ביפנית

    סריקה והמרה של טקסט מסוגנן בחוברות לקובצי טקסט לצורכי חיפוש וקטלוג.

איפה זה נופל

הבעיה המרכזית היא שהמודל לא קורא עמודים שלמים. הוא אומן על חיתוכים של בועות דיבור ולא יודע לזהות את סדר הקריאה בעמוד מנגה או להפריד בעצמו בין טקסט לאיור. מי שרוצה לעבד עמוד שלם חייב להצמיד לו מודל איתור עצמים שיחתוך קודם כל בועה בועה.

בנוסף, הכרטיס מציין רגישות גבוהה לבלבול בין תווים דומים גרפית: סימני קריאה ושאלה ברוחב מלא לעומת חצי רוחב, אותיות ומספרים לטיניים, והחלפה בין סימני קאנג'י רגילים לשורשים בעלי קידוד יוניקוד שונה. זה אומר שלפני שמעבירים את הטקסט למנוע תרגום, תצטרכו להריץ עליו ניקוי ותיקון תווים.

שאלות
נפוצות

האם אפשר לזרוק אליו עמוד מנגה שלם והוא יוציא את הטקסט לפי הסדר?

לא. המודל אומן על חיתוכים ספציפיים של בועות וטקסט ולא על עמודים מלאים. אם תזינו עמוד שלם, התוצאה תהיה מבולגנת או שגויה לחלוטין. חייבים להשתמש קודם בכלי שמזהה את מיקום הבועות, חותך אותן, ורק אז שולח אותן לפענוח.

איך המודל מתמודד עם טקסט בעברית או באנגלית?

הוא מבוסס על מודל שתומך בשפות רבות ומכיל גם אנגלית, אבל האימון הנוכחי כוון ספציפית ליפנית במנגה. אין כאן התאמה או בדיקה על טקסט עברי, כך שאם התמונה מכילה עברית, אל תבנו על תוצאה סבירה.

למה אחוזי הדיוק ברמת המשפט נעצרו בשבעים אחוז?

המודל מפספס בעיקר ברמת התו הבודד, כמו בלבול בין סימני פיסוק מלאים לחצי מלאים או בין יוניקוד של שורש ליוניקוד של אות רגילה. בעיניים אנושיות זה נראה זהה, אבל מבחן דיוק מחמיר פוסל את כל המשפט על הבדל כזה.

איך מריצים

עם פחות ממיליארד פרמטרים ומשקל קבצים של 1.8 גיגה בייט, אתם יכולים להריץ אותו בקלות על כרטיס מסך ביתי צנוע או אפילו על מעבד רגיל אם זמן התגובה פחות קריטי. הוא נתמך ישירות בספריית transformers או דרך PaddleOCR, כך שאין צורך בתשתיות ענן יקרות או בהקמת שרתים מורכבים.

הקריאה למודל הגיונית כשבונים פייפליין מקומי לתרגום או לקריאה. אם כל מה שאתם צריכים זה לנתח כמה עמודים בודדים פעם בחודש, סביר להניח ששליחה למודל ראייה מסחרי גדול דרך API תחסוך לכם את הצורך לתחזק מודל חיתוך מקדים וסביבת ריצה משלכם.

pip install -U huggingface_hub
hf download jzhang533/PaddleOCR-VL-For-Manga

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור או פתוח, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗