GPT
D

Dolphin

קוד פתוח

ByteDancemit2025-05-19

  • transformers
  • safetensors
  • vision-encoder-decoder
  • image-text-to-text
  • document-parsing

מודל פיענוח מסמכים קטן שמנתח מבנה עמוד ומחלץ נוסחאות, טבלאות וטקסט. הוא מתאים למי שרוצה לעבד סריקות ומאמרים מקומית בלי מפלצות של עשרות גיגה-בייט.

  • 398Mפרמטרים
  • 770 MBמשקל הקבצים
  • 922הורדות בחודש
  • 519לייקים

מה זה

במקום להסתמך על מודל ענק שינחש את כל המסמך בפעימה אחת, המודל הזה עובד בשני שלבים מוגדרים. בשלב הראשון הוא ממפה את מבנה העמוד ומסדר את האלמנטים לפי סדר קריאה הגיוני, ובשלב השני הוא מקבל הנחיות ספציפיות ומפענח במקביל פסקאות, טבלאות, תרשימים ונוסחאות מתמטיות מורכבות.

הבסיס הטכני שלו משלב בין Swin Transformer לעיבוד התמונה לבין מפענח MBart לחילוץ הטקסט, בתצורת VisionEncoderDecoder סטנדרטית של transformers. עם 398 מיליון פרמטרים ומשקל קבצים של 770 מגה-בייט בלבד, הוא מציע גישה קלת משקל בהשוואה לכלים כבדים, כשהוא מתבסס על רעיונות מפרויקטים כמו Nougat ו־Donut אבל מפרק את המשימה לעוגנים ברורים.

מתאים ל

  • פיענוח מאמרים באנגלית

    חילוץ מדויק של נוסחאות מתמטיות וטקסט לפי סדר הקריאה מתוך קובצי מאמרים סרוקים.

  • חילוץ טבלאות מתמונות

    שליחת חיתוך של טבלה מתוך דוח באנגלית או סינית וקבלת המבנה הסדור שלה.

  • עיבוד מסמכים מקומי וזול

    הרצה מקומית על חומרה צנועה לניתוח כמויות גדולות של סריקות ללא תלות ברשת.

איפה זה נופל

המודל הוגדר ואומן על שפות אנגלית וסינית בלבד, כך שעבור מסמכים בעברית הוא פשוט לא רלוונטי ויחזיר ג'יבריש. בנוסף, הכרטיס לא כולל מדדי ביצועים מספריים או השוואות כמותיות מול כלים אחרים, אלא רק מצהיר על ביצועים מבטיחים, כך שאי אפשר לדעת מראש מה שיעור השגיאה בנוסחאות מסובכות או בטבלאות שבורות. העבודה בשני שלבים דורשת מכם גם לממש את הלוגיקה של העברת העוגנים לשלב השני כדי לקבל תוצאה מלאה.

אותה משפחה

Dolphin יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך במסמכים בעברית?

לא. המודל מוגדר ותומך בשפות אנגלית וסינית בלבד, על בסיס מפענח MBart שאומן למטרות אלו. ניסיון להריץ אותו על סריקות בעברית יפיק פלט שגוי לחלוטין.

איך המודל מתמודד עם עמוד שמכיל נוסחאות וטקסט מעורבבים?

בשלב הראשון הוא מנתח את הפריסה של העמוד כולו ומזהה איפה יושב כל רכיב לפי סדר הקריאה. בשלב השני הוא משתמש בעוגנים ובהנחיות ייעודיות כדי לפענח כל אלמנט בנפרד, כולל נוסחאות מורכבות.

איך מריצים

המודל שוקל 770 מגה-בייט ורץ ב־float16, כך שמבחינת חומרה לא צריך שרת יקר. אפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי עם 4 עד 6 גיגה-בייט זיכרון, וגם הרצה על מעבד רגיל תעבוד בלי בעיות מיוחדות. הוא נטען ישירות דרך ספריית transformers הרגילה של Hugging Face.

יש שתי צורות עבודה מול הקוד שלו, ניתוח של עמוד מלא בבת אחת או פירוק ממוקד של אלמנט בודד כמו טבלה או נוסחה מתוך תמונה חתוכה. אם אתם צריכים רק להוציא מדי פעם טקסט פשוט מ־PDF סרוק, עדיף לפנות ל־API חיצוני מוכן, אבל אם אתם מעבדים נפחים של מסמכים טכניים ומאמרים וצריכים לחסוך עלויות ענן, להריץ אותו אצלכם זו החלטה הגיונית לגמרי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ByteDance/Dolphin")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה של המודל כחלק ממוצר סגור. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקוד או בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗