GPT
D

Dolphin-v2

קוד פתוח

ByteDanceרישיון לא דווח2025-12-01

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • document-parsing

מודל ראייה ושפה קומפקטי שמפרק תמונות של מסמכים למבנה נתונים מסודר. הוא יודע להבדיל בעצמו בין מסמך דיגיטלי נקי לבין דף מצולם עם עיוותים.

  • 3.8Bפרמטרים
  • 128,000טוקנים בהקשר
  • 7.0 GBמשקל הקבצים
  • 854הורדות בחודש

מה זה

מדובר במודל שמבוסס על Qwen2.5-VL בגודל של כמעט 3.8 מיליארד פרמטרים, שנועד למשימה אחת בלבד: לקחת תמונה של עמוד ולהחזיר את כל התוכן שלו בצורה מובנית. הוא מזהה 21 סוגי אלמנטים שונים, מכותרות ברמות שונות ופסקאות, ועד טבלאות שהוא ממיר ל־HTML, נוסחאות מתמטיות ב־LaTeX ובלוקים של קוד שבהם הוא שומר על ההזחות המקוריות.

הגישה שלו מחולקת לשני שלבים. קודם הוא מזהה את סוג המסמך ומנתח את סדר הקריאה והמיקומים בפיקסלים, ורק אז ניגש לקרוא את התוכן. במסמכים מצולמים הוא קורא את כל העמוד יחד כדי להתמודד עם עיוותים אופטיים, ובמסמכים דיגיטליים הוא מסוגל לחלק את העבודה ולקרוא אלמנטים במקביל. במבחני OmniDocBench 1.5 הוא קיבל ציון כולל של 89.45 עם מרחק עריכה נמוך מאוד של 0.054 בטקסט ובסדר הקריאה, מה שאומר שהוא כמעט לא מפספס את הרצף הנכון של העמוד.

מתאים ל

  • המרת מאמרים מדעיים

    הוא ממיר נוסחאות ל־LaTeX וטבלאות ל־HTML תוך שמירה מדויקת על סדר הקריאה בעמוד.

  • סריקת תיעוד טכני

    הוא כולל זיהוי ייעודי לקטעי קוד ושומר על הרווחים וההזחות המקוריות של התחביר.

  • עיבוד דפים מצולמים

    הוא מזהה צילומי מסמכים עקומים ומעבד את העמוד בשלמותו במקום להישבר על עיוותים.

איפה זה נופל

הנתונים מדברים רק על אנגלית וסינית, ואין שום תיעוד לתמיכה בעברית או בשפות שנכתבות מימין לשמאל. אם תזרקו עליו חוזה ישראלי, סביר להניח שסדר הקריאה והאלמנטים ישתבשו לחלוטין. בנוסף, חלוקת העבודה לשני שלבים דורשת ניהול תהליך מורכב יותר מסתם שליחת תמונה לפרומפט יחיד, במיוחד במסמכים דיגיטליים שבהם המודל מסתמך על פרומפטים ייעודיים לכל סוג תוכן.

אותה משפחה

Dolphin יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לקריאת מסמכים בעברית?

לא מומלץ. כרטיס המודל מציין תמיכה באנגלית ובסינית בלבד, ומודלים שלא אומנו על עברית לרוב הופכים את הטקסט או כושלים בזיהוי סדר המילים.

מה ההבדל המרכזי בינו לבין הגרסה הראשונה?

הוא תומך ב־21 קטגוריות תוכן במקום 14, כולל בלוקים של קוד עם הזחות, ועובד עם קואורדינטות פיקסלים מדויקות למיקום האלמנטים.

איך מריצים

המשקלים שוקלים 7 גיגה-בייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 12 או 16 גיגה זיכרון יריץ אותו בלי מאמץ מיוחד. הוא רץ ישירות דרך ספריית transformers עם ארכיטקטורת Qwen2_5_VLForConditionalGeneration הרגילה.

אם אתם צריכים לפרק רק כמה עשרות מסמכים פעם בשבוע, אין טעם להחזיק שרת דלוק בשבילו. לעומת זאת, כשיש נפח קבוע של קבצים שצריך לעבד מקומית בלי תלות ברשת, החומרה הנדרשת עבורו זולה מספיק כדי להצדיק שרת ייעודי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ByteDance/Dolphin-v2")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. זה משאיר אתכם באי ודאות מוחלטת לגבי שימוש מסחרי, הפצה או שילוב בתוך מוצר. כל עוד ByteDance לא מפרסמת תנאי שימוש ברורים, שילוב של המשקלים האלה בקוד ייצור של חברה חושף אתכם לסיכון משפטי מיותר.

הרישיון המלא בעמוד המודל ↗