GPT
N

nougat-base

קוד פתוח

facebookcc-by-nc-4.02023-09-21

  • transformers
  • pytorch
  • safetensors
  • vision-encoder-decoder
  • image-text-to-text

ממיר עמודי PDF של מאמרים אקדמיים ישירות לטקסט בפורמט מרקדאון. הוא קורא את הפיקסלים של התמונה ומחלץ נוסחאות מתמטיות ומבנה בלי להסתמך על שכבת טקסט בקובץ.

  • 349Mפרמטרים
  • 2.6 GBמשקל הקבצים
  • 95,979הורדות בחודש
  • 189לייקים

מה זה

המודל פותח על ידי פייסבוק במטרה לפתור בעיה מוכרת של חילוץ תוכן מקבצי PDF מדעיים. במקום להשתמש במנועי OCR קלאסיים שמתקשים עם טבלאות ומשוואות מורכבות, הוא ניגש למסמך כאל תמונה בלבד ומייצר את המרקדאון באופן אוטורגרסיבי. הארכיטקטורה שלו מבוססת על Donut, המשלבת מקודד תמונה מסוג Swin Transformer יחד עם מפענח טקסט מסוג mBART.

עם כ־349 מיליון פרמטרים, מדובר במודל קומפקטי יחסית שמתמקד כולו במעבר מפיקסלים לתחביר קריא. מכיוון שהוא אומן ספציפית על ספרות מדעית, הוא מסוגל לתרגם סימונים גרפיים ישירות לקוד מתמטי תואם, בלי להזדקק לתוכנות צד שלישי לפענוח פונטים מוטמעים או לתיקון סדר הקריאה בעמודות מקבילות.

מתאים ל

  • המרת מאמרים למרקדאון

    חילוץ טקסט מלא ממאמרים אקדמיים ישירות לתחביר נקי וקריא שמתאים למערכות ידע.

  • שחזור נוסחאות מדעיות

    זיהוי משוואות מתמטיות מתוך צילומי עמודים ותרגומן לסימון טקסטואלי מסודר.

  • אינדוקס מסמכי מחקר

    הפיכת קובצי PDF סרוקים לטקסט מובנה לצורך חיפוש וניתוח במאגרי מידע פנימיים.

איפה זה נופל

המודל אומן על מאמרים מדעיים, ולכן הוא לא מתאים למסמכים שסוטים מהמבנה הזה כמו חשבוניות, טפסים ממשלתיים או חוזים מורכבים. בנוסף, מפענחי טקסט אוטורגרסיביים נוטים להיכנס ללולאות חזרתיות אינסופיות כשהם נתקלים בגרפיקה שהם לא מזהים או בסריקות באיכות נמוכה. הוא מקבל פיקסלים בלבד, כך שאם המסמך המקורי קטום, מטושטש או עקום מדי, המודל עלול להמציא טקסט במקום להתריע על שגיאה.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

לא. המודל אומן על ספרות מדעית בינלאומית בעיקר באנגלית ומתמטיקה. הרצה שלו על מסמכים בעברית תוביל לפלט שגוי, להזיות או לרצף אותיות משובש לחלוטין.

האם אפשר להשתמש בו במערכת מסחרית בתשלום?

לא, הרישיון אוסר זאת מפורשות. רישיון cc-by-nc-4.0 מגביל את השימוש למטרות לא מסחריות בלבד, ולכן הטמעה במוצר מסחרי תהווה הפרה של תנאי השימוש של פייסבוק.

איך הוא מסתדר עם טבלאות מורכבות?

הוא מנסה להמיר טבלאות למרקדאון על בסיס המראה החזותי שלהן. במקרים של טבלאות צפופות, תאים מפוצלים או נתונים ללא גבולות ברורים, הוא עלול לשבש את הסדר ולייצר פלט שבור.

איך מריצים

טוענים את המודל ישירות דרך ספריית transformers בפייתון באמצעות VisionEncoderDecoderModel. קבצי המשקלים שוקלים 2.6 גיגה בייט ומגיעים בדיוק של float32, כך שכל כרטיס מסך מודרני פשוט עם לפחות 6 או 8 גיגה זיכרון וידאו יחזיק אותו בקלות בריצה מקומית, וגם ריצה על מעבד אפשרית בלי להתרסק.

אם אתם צריכים לעבד מדי פעם כמה עמודים, להרים אותו עצמאית זה מהיר וחסכוני. מנגד, אם יש לכם צבר של מיליוני עמודים לפענח בזמן קצר, שרשור התמונות למודל אוטורגרסיבי ידרוש מכם להחזיק קלאסטר שרתים עם כרטיסי מסך פעילים, ובמצב כזה שירותי פענוח מנוהלים דרך API עשויים לחסוך תחזוקה תשתיתית.

from transformers import pipeline

pipe = pipeline("image-to-text", model="facebook/nougat-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, שמשמעותו שימוש לא מסחרי בלבד. אתם יכולים לחקור אותו, להריץ ניסויים פנימיים או להשתמש בו באקדמיה, אך אסור לשלב אותו בכל מוצר, פיצ'ר או שירות שמניבים הכנסה או מיועדים למכירה.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗