GPT
P

pix2text-mfr

קוד פתוח

breezedeusmit2024-02-11

  • transformers
  • onnx
  • vision-encoder-decoder
  • image-text-to-text
  • latex-ocr

פתרון ממוקד להמרת תמונות של נוסחאות מתמטיות לקוד LaTeX נקי. שוקל 112 מגה בלבד ומתאים למי שחייב OCR מתמטי מהיר מקומית בלי לגרור מודלי ענק.

  • 112 MBמשקל הקבצים
  • 207,306הורדות בחודש
  • 58לייקים

מה זה

הבסיס כאן הוא ארכיטקטורת TrOCR של מיקרוסופט שעברה אימון ייעודי על תמונות של נוסחאות מתמטיות, גם מודפסות וגם בכתב יד. המטרה יחידה וברורה, אתם מזינים תמונה שמכילה משוואה והוא פולט ייצוג טקסטואלי בפורמט LaTeX. הגודל הזעיר שלו, 112 מגה בייט בסך הכול, הופך אותו לפתרון קל משקל שרץ כמעט בכל סביבה בלי לדרוש משאבי ענן כבדים.

במבחן ביצועים שהיוצר ערך מול 485 תמונות אמיתיות שהעלו משתמשים לשירות המקוון שלו, המודל נמדד לפי מדד שגיאות תווים לאחר נירמול רווחים. המאגר כלל נוסחאות באורכים שונים, החל מאותיות בודדות ועד מטריצות מורכבות. לפי הנתונים בכרטיס, הגרסה החינמית הזו עקפה את הגרסאות הקודמות של המוצר, אם כי היוצר מציין במפורש שקיימת אצלו גם גרסה מסחרית בתשלום שמגיעה לדיוק גבוה יותר.

מתאים ל

  • המרת מחברות סרוקות

    מפענח משוואות מורכבות וכתב יד ישר לתוך מסמכי LaTeX בלי להקליד ידנית.

  • חילוץ נוסחאות ממאמרים

    משתלב בצנרת עיבוד מסמכים אקדמיים כדי לחלץ מטריצות ומשוואות לקוד נקי.

  • עיבוד תמונות מקומי ומהיר

    רץ ישירות על מעבד של שרת פשוט בזכות משקל של 112 מגה בייט בלבד.

איפה זה נופל

הוא מיועד למשוואות מתמטיות בלבד. הכרטיס מדגיש שאם תנסו להזין תמונות עם תוכן אחר, הוא פשוט לא יעבוד. בנוסף, אם מריצים אותו ישירות ללא החבילה המעטפת, הוא לא יודע לחתוך או לאתר נוסחה מתוך דף שלם אלא דורש תמונה מבודדת של המשוואה עצמה.

שאלות
נפוצות

האם המודל יודע לקרוא דף שלם עם פסקאות ומשוואות יחד?

לא באופן ישיר. המודל עצמו מקבל רק תמונות של נוסחאות חתוכות, ואם תריצו אותו ישירות הוא ייכשל על טקסט רגיל. כדי לעבד דף מעורב צריך להתקין את ספריית pix2text שמפעילה מודל זיהוי מקדים שחותך את הנוסחאות לפני הפענוח.

האם אפשר להריץ אותו על שרת בלי כרטיס מסך ייעודי?

כן, בלי שום בעיה. כל המודל שוקל 112 מגה בייט ורץ דרך onnxruntime, כך שמעבד רגיל יספיק כדי לקבל זמני תגובה טובים מאוד.

איך מריצים

ההרצה פשוטה מאוד ומתבססת על transformers יחד עם ספריית optimum להרצה דרך onnxruntime. בגלל המשקל הנמוך, אין שום צורך במאיץ גרפי חזק, המודל עובד ישירות על מעבד רגיל של שרת או מחשב פיתוח בלי להרגיש עומס מיוחד.

יש שתי דרכים לעבוד איתו. הראשונה היא שימוש ישיר במודל דרך הקוד כדי לפענח תמונות שכוללות נוסחה גזורה בלבד. השנייה היא התקנת חבילת pix2text המלאה, שמשלבת מודל גילוי נוסחאות ויודעת להתמודד עם מסמך מעורב שכולל טקסט רגיל לצד משוואות. יש ליוצר גם שירות רשת חינמי לבדיקות מהירות, אבל בקובצי משקל כאלה קל ומשתלם בהרבה להריץ מקומית בפייתון.

from transformers import pipeline

pipe = pipeline("image-to-text", model="breezedeus/pix2text-mfr")
print(pipe("שלום"))

הרישיון

רישיון MIT מלא. אפשר להשתמש בו חופשי לצרכים מסחריים, לשנות את הקוד ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של היוצר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗