GPT
S

SmolDocling-256M-preview

קוד פתוח

docling-projectcdla-permissive-2.02025-02-12

  • transformers
  • onnx
  • safetensors
  • idefics3
  • image-text-to-text

מודל ראייה קטן שממיר תמונות של מסמכים שלמים למבנה מוגדר, כולל נוסחאות, טבלאות וקוד. הוא נבנה כדי לחסוך משאבי חישוב כבדים בזיהוי מסמכים.

  • 256Mפרמטרים
  • 8,192טוקנים בהקשר
  • 3.3 GBמשקל הקבצים
  • 26,448הורדות בחודש

מה זה

מדובר במודל מולטימודלי זעיר של 256 מיליון פרמטרים בלבד שמבוסס על SmolVLM וארכיטקטורת Idefics3. המטרה שלו היא לקחת תמונה של עמוד ולהוציא ממנה טקסט יחד עם כל המבנה: כותרות, רשימות, בלוקים של קוד עם הזחות, משוואות מתמטיות בפורמט LaTeX, טבלאות ותרשימים. בשונה ממודלים שמנסים להקיא ישר Markdown או HTML ומבזבזים טוקנים על תגיות מסורבלות, הוא פולט פורמט ייעודי בשם DocTags שמפריד בין המבנה לטקסט.

הפורמט הזה מתממשק ישירות לספריית Docling, שמשם קל לייצא לכל קובץ שנרצה על גבי ה־CPU. לפי המדידות של המפתחים, בהרצה עם vLLM על גבי מאיץ A100 המודל מעבד עמוד בממוצע של 0.35 שניות. זה קצב מהיר שמאפשר לטחון כמויות של מסמכים בלי צוואר בקבוק משמעותי בחומרה גרפית, למרות שמדובר במשימת פירוק מסמך מלאה.

מתאים ל

  • המרת מאמרים אקדמיים

    הוא מזהה משוואות וממיר אותן ל־LaTeX לצד טבלאות ומבנה פסקאות מלא.

  • חילוץ נתונים מטבלאות

    הוא מפרק מבנה שורות ועמודות לקוד OTSL ייעודי ומדויק.

  • עיבוד קוד מתוך צילומי מסך

    הוא מזהה קטעי תכנות ושומר על הזחות נכונות בטקסט שמופק.

איפה זה נופל

החיסרון הברור ביותר הוא השפה, המודל אומן ותומך רשמית באנגלית בלבד. אם יש לכם מסמכים בעברית, חשבוניות מקומיות או טקסט דו כיווני, הוא פשוט לא מיועד לזה ולא ייצר תוצאות שמישות.

בנוסף, מדובר בגרסת תצוגה מקדימה, ובכרטיס המודל מצוין במפורש שגרסה חדשה יותר בשם granite-docling-258M כבר שוחררה ומחליפה אותו בתמיכה ועדכונים. המפתחים גם ציינו שפענוח תרשימים וזיהוי כימיקלים עדיין דורשים שיפור, ועיבוד של כמה עמודים במקביל עדיין לא נתמך במכה אחת.

אותה משפחה

SmolDocling יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה לפרויקט חדש?

עדיף לבדוק ישירות את granite-docling-258M. יוצרי המודל הודיעו שהוא היורש הישיר של הגרסה הזו, והוא זה שיקבל עדכונים ותמיכה שוטפת.

האם המודל יודע לקרוא עברית?

לא. המודל הוגדר ואומן לשפה האנגלית בלבד, ולכן מסמכים בעברית לא יעבדו בצורה תקינה.

איך מריצים

בגלל המשקל הקטן, 3.3 גיגה בייט של קבצים, אפשר להריץ אותו מקומית כמעט על כל כרטיס מסך בסיסי או מחשב מק עם מעבדי אפל דרך ספריות כמו vLLM, transformers, ONNX או MLX. הוא צורך מעט מאוד זיכרון בהשוואה למודלי ויז'ן רגילים, כך שלא חייבים שרת ייעודי כדי לבדוק אותו.

אם אתם צריכים לפענח עמודים בודדים מדי פעם, הרצה מקומית על מחשב פיתוח תעשה את העבודה בלי תלות באף ספק. מנגד, אם אין לכם תשתית ענן מנוהלת ויש צורך בעיבוד מיידי של מיליוני עמודים בבת אחת, שירותי צד שלישי שמארחים מודלים יחסכו מכם את תחזוקת השרתים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="docling-project/SmolDocling-256M-preview")
print(pipe("שלום"))

הרישיון

הרישיון המדווח במטא-דאטה הוא cdla-permissive-2.0, אף שבגוף הכרטיס מוזכר רישיון Apache 2.0. שני הרישיונות הללו מתירניים, מאפשרים שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצר, בלי חובה לשחרר את הקוד שלכם.

הרישיון המלא בעמוד המודל ↗