GPT
M

manga-ocr-base

קוד פתוח

kha-whiteapache-2.02022-03-02

  • transformers
  • pytorch
  • vision-encoder-decoder
  • image-text-to-text
  • image-to-text

מודל זיהוי תווים ייעודי לטקסט ביפנית, שנבנה ספציפית להתמודדות עם מנגה וקומיקס יפני. הוא מתאים למי שצריך לחלץ יפנית מתמונות שבהן מנועי ראייה רגילים פשוט נכשלים.

  • 424 MBמשקל הקבצים
  • 944,511הורדות בחודש
  • 180לייקים

מה זה

מדובר במודל image-to-text מבוסס VisionEncoderDecoder, שמתמקד בזיהוי טקסט מודפס ביפנית. בעוד שרוב מנועי ה־OCR הרגילים מניחים שהטקסט מסודר בשורות אופקיות ועל רקע נקי, המודל הזה תוכנן מראש כדי להתמודד עם המאפיינים הכאוטיים של חוברות קומיקס יפניות. הוא יודע לקרוא טקסט שנכתב בצורה אנכית ואופקית כאחד, ולא נשבר כשיש פוריגאנה, אותם סימני קאנה קטנים שמלווים קאנג'י מורכבים ונוטים לבלבל מערכות סטנדרטיות.

בנוסף, הוא בנוי לטפל בטקסט שיושב ישירות על גבי איורים ולא בתוך בועות דיבור מבודדות. סגנונות הגופנים במנגה משתנים דרמטית בין סצנות, ואיכות התמונה בסריקות דיגיטליות היא לעיתים קרובות נמוכה או דחוסה, כך שהעמידות שלו בתנאים האלה הופכת אותו לשימושי גם כמנוע OCR כללי ליפנית מודפסת, ולא רק לקומיקס.

מתאים ל

  • תרגום קומיקס יפני

    חילוץ מדויק של יפנית אנכית ופוריגאנה מתוך עמודי מנגה לקראת הזנה למנוע תרגום.

  • זיהוי יפנית בסריקות ישנות

    קריאת טקסט מודפס באיכות נמוכה או על רקע ציורים שאינם בועת דיבור נקייה.

  • כריית מידע מאיורים

    עיבוד תמונות עם גופנים מיוחדים ביפנית שספריות OCR סטנדרטיות נוטות לפספס.

איפה זה נופל

המודל מוגדר לשפה היפנית בלבד. הוא לא מיועד לעברית, לאנגלית או לכל שפה אחרת, כך שאין מה לנסות להריץ אותו על טקסט מערבי. הכרטיס מפרט עמידות לסריקות באיכות נמוכה, לגופנים מגוונים ולפוריגאנה, אך הוא מכוון לטקסט מודפס, כך שכתב יד אמיתי ובלתי מודפס עשוי להוות בעיה. בנוסף, חיתוך האזור הרלוונטי עדיין באחריותכם, המודל מקבל תמונה ומחלץ ממנה טקסט, הוא לא בהכרח יאתר לבד בועות דיבור מתוך עמוד שלם.

שאלות
נפוצות

האם המודל מזהה עברית או אנגלית?

לא. המודל אומן ספציפית על יפנית בלבד. הוא לא יזהה עברית, וניסיון להריץ עליו טקסט בשפות אחרות יניב פלט שגוי או ג'יבריש.

האם צריך כרטיס גרפי חזק כדי להריץ אותו?

ממש לא. כל הקבצים שוקלים 424 מגה בייט, כך שזיכרון העבודה הנדרש מינימלי. הוא ירוץ בלי בעיה גם על מעבד רגיל במחשב אישי.

איך מריצים

המודל שוקל 424 מגה בייט בלבד ומבוסס על ספריית transformers, כך שאין שום בעיה להריץ אותו מקומית. הוא לא דורש שרת ענן יקר או כרטיס גרפי כבד. מעבד רגיל יספיק לריצה בקצב סביר, וכרטיס מסך פשוט ייתן מהירות גבוהה בהרבה.

במשקל כזה קל לשלב אותו ישירות בקוד שלכם בלי תלות בשירותים חיצוניים. שווה לפנות ל־API חיצוני רק אם אתם בונים שירות שצריך לטפל במקביל באלפי תמונות בשנייה ולא רוצים לתחזק מכונות משלכם.

from transformers import pipeline

pipe = pipeline("image-to-text", model="kha-white/manga-ocr-base")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 424 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני מאוד. אתם יכולים להשתמש בו בחופשיות לפרויקטים אישיים או מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗