GPT
O

ocr-captcha-v3

קוד פתוח

anuashokapache-2.02024-11-15

  • safetensors
  • vision-encoder-decoder
  • vision
  • ocr
  • trocr

המודל פותר תמונות קפצ'ה טקסטואליות פשוטות בלי להקים מערך ראייה ממוחשבת כבד. הוא אומן ישירות על אותיות ומספרים מעוותים כדי לחלץ מחרוזת נקייה.

  • 334Mפרמטרים
  • 1.2 GBמשקל הקבצים
  • 93,575הורדות בחודש
  • 37לייקים

מה זה

מדובר בהתאמה של TrOCR של מיקרוסופט למשימה אחת בלבד, פענוח קפצ'ות ויזואליות עם רקע נקי או רועש קלות. במקום להשתמש במודל ראייה כללי של כמה מיליארדי פרמטרים או במנוע OCR רגיל שמתבלבל מתווים מעוותים, לקחו מודל טקסט מודפס קיים ואימנו אותו מחדש על דוגמאות ספציפיות.

כרטיס המודל מציג שגיאת תווים של 0.0139, כלומר קצת יותר מתו שגוי אחד על כל מאה תווים. בקפצ'ה ממוצעת של חמישה או שישה תווים, זה אומר שרוב הפענוחים יוצאים מדויקים במכה ראשונה, בהנחה שהתמונות שלכם דומות לדוגמאות שעליהן הוא אומן.

מתאים ל

  • סקריפטים לאיסוף מידע

    מעבר אוטומטי של מחסומי כניסה פשוטים באתרים שמציגים אותיות ומספרים מעוותים באנגלית.

  • בדיקות תוכנה ואוטומציה

    הרצת בדיקות מקצה לקצה בסביבות פיתוח בלי צורך לבטל ידנית מנגנוני אימות טקסטואליים.

  • פענוח מקומי ללא רשת

    חילוץ מחרוזות מתוך תמונות קטנות על השרת שלכם בלי לשלוח מידע לספקי API חיצוניים.

איפה זה נופל

הוא יודע לפתור רק את סוג הקפצ'ה הספציפי שמופיע בכרטיס המודל. אם יש לכם קפצ'ות מתקדמות עם חיתוכי קווים קשים, זיהוי אובייקטים, תמונות מטושטשות מאוד או טקסט בעברית, הוא ייכשל לגמרי. בנוסף, קצב השגיאות נמדד על סט נתונים שלא פורט במלואו, ולכן חובה לבדוק אותו על מאגר דגימות אמיתי מהמערכת שלכם לפני שסומכים עליו בתהליך אוטומטי.

שאלות
נפוצות

האם הוא מסוגל לקרוא קפצ'ות בעברית?

לא. המודל אומן על אותיות לטיניות ומספרים בלבד, כפי שמופיע בדוגמאות האימון שלו. טקסט בעברית יחזיר ג'יבריש או שגיאות פענוח מלאות.

האם כדאי להריץ אותו על מעבד בלבד בלי GPU?

אפשר בהחלט. 334 מיליון פרמטרים זה גודל שמעבד שרת מודרני מתמודד איתו בלי קושי, כל עוד אין לכם אלפי בקשות במקביל בכל שנייה.

איך מריצים

טוענים אותו דרך transformers עם TrOCRProcessor ו־VisionEncoderDecoderModel. משקל של 1.2 גיגה־בייט ו־334 מיליון פרמטרים אומר שאפשר להריץ אותו בקלות על כל כרטיס מסך בסיסי, ואפילו על מעבד רגיל בשרת אם אתם מוכנים לספוג זמני תגובה של כמה מאות מילישניות לפענוח.

בקוד המקור יש שלב עיבוד מקדים שמלביש את התמונה על רקע לבן כדי לנקות שקיפויות. אם התמונות שאתם מקבלים לא עוברות את ההכנה הזו, התוצאות יפגעו. שירותי ענן חיצוניים לפענוח קפצ'ה יעלו לכם כסף לכל קריאה ויחזיקו במידע, בעוד שהרצה עצמית כאן נותנת שליטה מלאה בחינם.

pip install -U huggingface_hub
hf download anuashok/ocr-captcha-v3

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך המוצר שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתח המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗