GPT
G

GOT-OCR-2.0-hf

קוד פתוח

stepfun-aiapache-2.02024-11-22

  • transformers
  • safetensors
  • got_ocr2
  • image-text-to-text
  • got

מודל ראייה וטקסט קומפקטי במיוחד לחילוץ מידע מתמונות ומסמכים. הוא שוקל קצת יותר מג'יגה בודד ומתמודד עם נוסחאות, טבלאות ותווים שרוב הכלים הקטנים מפספסים לחלוטין.

  • 561Mפרמטרים
  • 1.1 GBמשקל הקבצים
  • 165,448הורדות בחודש
  • 240לייקים

מה זה

מדובר במודל שמגיע עם 561 מיליון פרמטרים בלבד, גודל זעיר ביחס למודלי שפה וראייה מודרניים, אבל הוא מתוכנן מראש לבצע משימות OCR מורכבות מקצה לקצה. מעבר לקריאת טקסט רציף ממסמכים ומתמונות רחוב, הוא יודע לחלץ מבנים מורכבים ולהמיר אותם לפורמטים כמו Markdown או LaTeX. זה כולל טבלאות, תרשימים, נוסחאות מתמטיות, צורות גיאומטריות, מולקולות כימיות ואפילו תווים מוזיקליים.

הוא מביא איתו כמה יכולות ייחודיות לגודל שלו, כמו עיבוד כמה עמודים בבת אחת כדי לשמור על רצף עיצובי, חיתוך דינמי של תמונות כדי להתמודד עם רזולוציות בעייתיות, ויכולת אינטראקטיבית שבה אתם מעבירים קואורדינטות או צבע של תיחום כדי לחלץ אזור ספציפי בלבד.

מתאים ל

  • המרת מאמרים אקדמיים

    ממיר נוסחאות מתמטיות ותרשימים ישירות ל־LaTeX מדויק בלי צורך בכלי ייעודי נפרד.

  • חילוץ ממוקד לפי אזור

    מאפשר לשלוח קואורדינטות של שדה בודד במסמך ולקרוא רק אותו, בלי לעבד את כל הדף.

  • סריקת טבלאות מורכבות

    מזהה מבנה של טבלאות ומייצר פלט Markdown נקי ששומר על הסדר של העמודות.

איפה זה נופל

המימוש הנוכחי מוציא טקסט גולמי בלבד. אם תרצו לקבל בחזרה תווים מוזיקליים, תרשימים גרפיים או מסמכים מעוצבים, תצטרכו להעביר את הפלט שלו דרך כלים חיצוניים כמו pdftex, matplotlib או verovio כדי לרנדר את התוצאה הסופית.

מעבר לזה, ברירת המחדל של המודל היא רזולוציה של 1024 על 1024 פיקסלים. על מסמכים עם יחס תמונה חריג או עמודים כפולים של מאמרים אקדמיים, הוא עלול לפספס תוכן או לדייק פחות אלא אם תפעילו את מנגנון החיתוך הדינמי שלו.

שאלות
נפוצות

האם המודל מייצר קבצי תמונה או גרפיקה של התווים והנוסחאות שהוא קורא?

לא. המודל מחזיר אך ורק ייצוג טקסטואלי, כמו קוד LaTeX או סימול תווים גולמי. אם אתם רוצים להציג את התוצאה כגרפיקה, תצטרכו לקחת את הטקסט ולהעביר אותו בספריות רינדור חיצוניות.

איך המודל מתמודד עם תמונות רחבות מאוד או עמודים סרוקים כפולים?

ברזולוציית ברירת המחדל שלו הוא עשוי לזייף במסמכים כאלה. הפתרון שמציעים היוצרים הוא להשתמש במצב חיתוך הפאצ'ים הדינמי, שמחלק את התמונה למקטעים, קורא אותם ומחבר את הפלט בצורה רציפה.

איך מריצים

בזכות משקל של 1.1 גיגה בייט בלבד, המודל הזה רץ כמעט על כל חומרה. כרטיס מסך בסיסי עם 4 או 6 גיגה של VRAM מחזיק אותו בלי בעיה בפורמט bfloat16 שבו הוא מופץ, ואפשר להריץ אותו אפילו על מעבד רגיל אם זמן התגובה פחות קריטי לכם. הוא עובד ישר מתוך transformers עם GotOcr2ForConditionalGeneration בלי צורך בהתקנות מיוחדות.

אם כל מה שאתם צריכים זה לחלץ טקסט רגיל מפעם לפעם, כנראה שעדיף לשלוח בקשה ל־API קיים ולא לתחזק שרת. תריצו אותו לבד רק אם יש לכם נפח עבודה קבוע, דרישות פרטיות שמחייבות ריצה מקומית, או צורך בחילוץ מותאם של נוסחאות ותרשימים שכלים גנריים גובים עליהם מחיר מופקע.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="stepfun-ai/GOT-OCR-2.0-hf")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או כחלק ממוצר שאתם מוכרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗