GPT
T

TexTeller

קוד פתוח

OleehyOapache-2.02024-02-10

  • transformers
  • pytorch
  • onnx
  • safetensors
  • vision-encoder-decoder

הכלי ממיר תמונות של נוסחאות מתמטיות לקוד LaTeX נקי. מדובר במודל ראייה קטן וממוקד שחוסך את הצורך בהקלדה ידנית של משוואות מורכבות.

  • 298Mפרמטרים
  • 5.0 GBמשקל הקבצים
  • 9,958הורדות בחודש
  • 45לייקים

מה זה

המודל מתבסס על ארכיטקטורת VisionEncoderDecoder וכולל 298 מיליון פרמטרים. המטרה שלו פשוטה ומוגדרת, לקחת תמונה שמכילה נוסחה מתמטית, כולל תמונות שצולמו בסביבה טבעית ולא רק סריקות מושלמות, ולתרגם אותה לתחביר LaTeX מוכן לשימוש.

לפי התיעוד הוא אומן על מאגר של 550 אלף זוגות של תמונות ונוסחאות, לעומת כ־100 אלף במודל הוותיק LaTeX-OCR. נפח הנתונים הגדול יותר אמור לתת לו עמידות גבוהה יותר בווריאציות צילום שונות ובמבנים מתמטיים מגוונים. היוצר מציין גם גרסת המשך עם מאגר נתונים רחב עוד יותר לטיפול בנוסחאות מרובות שורות, מטריצות וסימנים נדירים.

מתאים ל

  • דיגיטציה של ספרי לימוד

    חיתוך משוואות מסריקות של ספרי מתמטיקה והמרה שלהן לטקסט חי שניתן לערוך.

  • המרת צילומי לוח

    תרגום תמונות של נוסחאות שנכתבו בהרצאה ישירות לתחביר LaTeX שמשתלב בסיכומים.

  • צינור עיבוד למאמרים

    חילוץ אוטומטי של נוסחאות מקובצי מאמרים מדעיים והזנתן למאגרי מידע ממוחשבים.

איפה זה נופל

זה לא מודל שמבין מתמטיקה או טקסט חופשי, הוא רק מנסה לפענח מבנה חזותי לטקסט. הדף הרשמי מודה בעקיפין שבמבנים סבוכים במיוחד, מטריצות רחבות או סימנים מתמטיים נדירים, הגרסה הראשונית עלולה לפספס. כמו כן, הוא תלוי באיכות החיתוך סביב הנוסחה, כך שאם תזרקו עליו דף שלם מלא פסקאות ולא תמונה מבודדת של המשוואה, תקבלו כנראה פלט שבור.

שאלות
נפוצות

האם המודל יודע לקרוא עמוד שלם של מסמך?

לא. הוא נבנה לזיהוי נוסחאות ממוקדות. תצטרכו להשתמש בכלי אחר שיאתר ויחתוך את אזור הנוסחה מתוך העמוד לפני שמעבירים אותה לעיבוד כאן.

כמה זיכרון כרטיס מסך נדרש להרצה מקומית?

משקל הקבצים עומד על 5 גיגה-בייט והמודל מכיל כ־298 מיליון פרמטרים. כרטיס עם 6 עד 8 גיגה-בייט זיכרון יחזיק אותו בקלות עבור הסקה של תמונה בודדת.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות VisionEncoderDecoderModel. קובצי המשקל שוקלים כ־5 גיגה-בייט, כך שלא צריך מפלצת חישובית בשביל להריץ אותו. כרטיס מסך בסיסי עם 6 עד 8 גיגה-בייט זיכרון יספיק לחלוטין לצורך הסקה שוטפת, ואפשר לדחוף אותו גם על מעבד רגיל אם זמן התגובה פחות קריטי.

אם אתם צריכים לפענח נוסחה אחת פעם בחודש, עדיף להשתמש במודל רב-מודאלי כללי דרך ממשק קיים. היתרון בהרצה עצמאית מגיע ברגע שיש לכם צינור עיבוד של אלפי מסמכים וסריקות, שבו קריאות חיצוניות הופכות לאיטיות ויקרות.

from transformers import pipeline

pipe = pipeline("image-to-text", model="OleehyO/TexTeller")
print(pipe("שלום"))

הרישיון

הרישיון כאן הוא Apache 2.0. מותר לקחת את המשקלים, לשלב אותם במוצר מסחרי, לשנות את הקוד ולהריץ הכל על שרתים פנימיים בלי לשלם תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗