GPT
L

lift

קוד פתוח

datalab-toopenrail2026-06-19

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • pdf

חילוץ נתונים מובנים ממסמכים ותמונות ישירות לתוך סכמת JSON מוגדרת. הוא סוגר פינה למי שצריך לפענח קבצים שלמים בלי לשבור את המבנה של הפלט.

  • 9.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.0 GBמשקל הקבצים
  • 160,717הורדות בחודש

מה זה

מדובר במודל שמקבל תמונות של עמודי מסמך יחד עם סכמת JSON Schema, ומחזיר אובייקט שתואם בדיוק לשדות שהוגדרו. הבסיס שלו יושב על ארכיטקטורת Qwen 3.5 בגודל של כמעט עשרה מיליארד פרמטרים, כשהוא משתמש בפענוח מאולץ כדי להבטיח שהפלט יישאר חוקי ומיושר לסוגי הנתונים שביקשתם.

היתרון המרכזי כאן הוא היכולת לבלוע מסמכים מרובי עמודים בריצה אחת, גם כשערך מסוים מתחיל בעמוד אחד ומסתיים באחר. במבחן של 225 מסמכים מורכבים שפרסמה החברה, המודל הגיע לדיוק של 90.2% ברמת השדה הבודד, שזה קרוב מאוד לביצועים של מודלי ענן מסחריים כמו ג'מיני פלאש. זמן התגובה החציוני שלו עמד על 9.5 שניות, מהיר משמעותית מפתרונות קנייניים כבדים.

מתאים ל

  • עיבוד חשבוניות וקבלות

    חילוץ מספר מסמך, סכומים וטבלאות פריטים ישירות למבנה נתונים מוגדר היטב בלי שגיאות תחביר.

  • פיענוח טפסים מרובי עמודים

    קריאת חוזים ומסמכים סרוקים שבהם מידע ממשיך מעמוד אחד לבא אחריו בריצה אחת.

  • חילוץ נתונים עם vLLM מקומי

    סביבות שדורשות שרת עצמאי עם זמני תגובה של שניות בודדות לכל מסמך בלי תלות ברשת חיצונית.

איפה זה נופל

הדיוק ברמת המסמך המלא צונח ל־20.9% בלבד. זה אומר שבמסמך ממוצע עם עשרות שדות, ברוב המוחלט של המקרים לפחות שדה אחד ייפול או יחזור שגוי, מה שמחייב מנגנון בדיקה נוסף בקוד שלכם. בנוסף, המודל המקומי לא מספק מראי מקום למידע, לא נותן ציוני ביטחון לחילוץ, ולא כולל אימות פנימי.

שאלות
נפוצות

מה קורה כשיש שדה בסכמה שלא קיים במסמך?

המודל מחזיר ערך null עבור אותו שדה, בתנאי שלא הגדרתם אותו כחובה בסכמה. חשוב להגדיר שדות חובה רק למה שבאמת מופיע תמיד במסמכים שלכם.

האם כדאי להריץ אותו דרך transformers או vLLM?

עדיף להשתמש ב־vLLM. ההתקנה קלה יותר, ניהול המשאבים יעיל בהרבה, ובנצ'מרק המהירות של החברה מתבסס עליו כדי להגיע לזמני עיבוד של שניות ספורות.

איך מריצים

כדי להריץ אותו מקומית מורידים 18 גיגה-בייט של משקולות. תצטרכו כרטיס מסך מודרני עם לפחות 24 גיגה-בייט זיכרון כדי להחזיק את המודל ולעבד עמודים ברזולוציה סבירה, במיוחד עם חלון הקשר ארוך.

אפשר להריץ אותו דרך ספריית lift-pdf בשילוב vLLM, שזו הדרך המומלצת והקלה יותר לפי הדוקומנטציה, או ישירות דרך transformers של פייתון. אם אין לכם שרת ייעודי זמין או שאתם חייבים אימות לכל שדה ומראי מקום מדויקים, הגרסה המנוהלת ב־API של החברה תהיה פשוטה בהרבה לתחזוקה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="datalab-to/lift")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת אפאצ'י 2, אבל המשקולות משתמשות ברישיון אופן-רייל מותאם אישית. השימוש חינמי למחקר, פרויקטים אישיים וסטארטאפים עם הכנסות או גיוסים מתחת לחמישה מיליון דולר. אם עברתם את הרף, או אם אתם בונים מוצר שמתחרה ישירות ב־API של החברה, אתם מחויבים לרכוש רישיון מסחרי נפרד.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗