GPT
N

NuExtract-2.0-8B

קוד פתוח

numindmit2025-05-06

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • conversational

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

המודל הזה לוקח טקסט או תמונה ומחלץ מהם נתונים ישירות למבנה JSON מוגדר מראש. הוא מתאים למי שחייב פלט מובנה ואמין בלי לכתוב פרומפטים מפותלים למודל כללי.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 6,460הורדות בחודש

מה זה

במקום לתת תשובות חופשיות או לנהל שיחה, המודל הזה אומן למטרה אחת: חילוץ מידע מובנה לפי סכמה. הבסיס שלו מגיע ממשפחת Qwen2.5-VL, והוא מסוגל לקרוא מסמכים סרוקים, תמונות או טקסט רגיל, ולהחזיר JSON שתואם בדיוק להגדרות שהגדרתם בטמפלייט.

השוני העיקרי מול מודלים כלליים באותו סדר גודל הוא התמיכה המובנית בסוגי שדות ספציפיים. אפשר להגדיר לו חילוץ מילולי מדויק מהמקור, שדות מופשטים, תאריכים, מספרים וערכי בחירה מרובים. אם מידע מסוים חסר בקלט, הוא מחזיר null במקום להמציא ערך, מה שחוסך הרבה עבודת אימות בקוד.

מתאים ל

  • חילוץ נתונים מחשבוניות

    הוא מקבל תמונה או סריקה ומחלץ תאריכים, סכומים ושמות ספקים ישר לשדות מתאימים.

  • עיבוד טפסי רישום

    התאמת שדות לבחירה מרובה וערכי טקסט מתוך טפסים סרוקים ישירות לפורמט בסיס נתונים.

  • המרה של קבצים למבנה JSON

    המרת תיאורי מוצר או טקסטים חופשיים למידע מובנה עם שדות מוגדרים מראש.

איפה זה נופל

חובה להריץ אותו בטמפרטורה אפס או קרוב מאוד לזה. סביבות הרצה רבות מגדירות כברירת מחדל טמפרטורה של 0.7, מה שגורם לו לחרוג מהמבנה הנדרש. אם המשימה כוללת עמימות או דרישות עיצוב מורכבות, הוא מתקשה בלי דוגמאות בתוך הפרומפט, כך שתצטרכו להנדס עבורו דוגמאות קלט ופלט כדי לקבל עקביות.

אותה משפחה

NuExtract-2.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בחילוץ של מספר תמונות בבקשה אחת?

כן, ניתן להעביר מספר תמונות באותה בקשה. בשימוש דרך vLLM נדרש להגדיר את מגבלת המולטימודל פר פרומפט, ולסדר את התמונות ברצף הנכון אם מוסיפים דוגמאות.

מה קורה כששדה מסוים לא מופיע בטקסט או בתמונה?

במקום להמציא מידע, המודל מחזיר null עבור ערכים בודדים או מערך ריק עבור רשימות. זה מאפשר לוודא תקינות ישירות מול הסכמה בלי סינון הזיות.

למה לבחור בו במקום במודל רגיל של 8B?

הוא מאומן מראש להחזיר JSON תקני לפי סוגי נתונים כמו תאריכים ומספרים, כך שאין צורך בפרומפטים ארוכים שמנסים לאלץ את הפורמט.

איך מריצים

המשקל עומד על 15.5 גיגה בייט בפורמט bfloat16, כך שתצטרכו כרטיס מסך עם לפחות 24 גיגה בייט של VRAM כדי להריץ אותו בנוחות, במיוחד אם מנצלים את חלון ההקשר הגדול או מנתחים תמונות כבדות. אפשר להרים אותו מקומית עם vLLM בשרת תואם OpenAI, או להשתמש בטרנספורמרס ישירות בקוד.

גרסת ה־8B מציעה רישיון פתוח לעומת גרסת ה־4B שמוגבלת למחקר בלבד. יש גם גרסת 2B קלה ופתוחה, אבל למי שצריך דיוק גבוה על מסמכים מורכבים ולא רוצה לתחזק שרת GPU ייעודי, NuMind מציעים גם גישה דרך API שמייתרת את החומרה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="numind/NuExtract-2.0-8B")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT מלא. אפשר להשתמש בו למוצרים מסחריים, לשנות אותו, להריץ אותו בענן פרטי או להטמיע אותו במערכות פנימיות בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗