GPT
N

NuExtract-2.0-2B

קוד פתוח

numindmit2025-05-28

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • conversational

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

פתרון קומפקטי שמחלץ נתונים מטקסט ומסמכים סרוקים ישירות למבנה JSON מוגדר מראש. הוא שומר על רישיון מסחרי חופשי, בניגוד לגרסאות מקבילות שדורשות אישורים מיוחדים.

  • 2.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 4.1 GBמשקל הקבצים
  • 90,376הורדות בחודש

מה זה

מדובר במודל שנועד למטרה בודדת, והיא קריאת טקסט או תמונות והחזרת המידע בתוך מבנה נתונים קשיח. במקום לבקש ממודל שפה כללי לנחש את הפורמט, אתם שולחים לו תבנית עם שדות מוגדרים כמו מחרוזות מדויקות, מספרים, תאריכים או רשימות סגורות, והוא מחזיר רק את הערכים האלה או ערך ריק אם המידע חסר.

הוא מתבסס על Qwen2-VL ולא על הגרסה החדשה יותר, דווקא כדי לשמור על רישיון פתוח לחלוטין לשימוש מסחרי. המפתחים אימנו אותו לתמוך בכמה שפות וגם בקלט ויזואלי של מסמכים, כך שאפשר לתת לו צילום של קבלה או מסמך ולקבל נתונים מובנים בלי לפרק את המשימה לשלבי זיהוי טקסט נפרדים.

מתאים ל

  • קריאת נתונים מחשבוניות

    הוא יודע לקבל צילום של מסמך ולהוציא סכומים, תאריכים ושמות ישירות למבנה נתונים מסודר.

  • ניתוח טקסטים חופשיים

    חילוץ פרטים ספציפיים מתוך טקסט לקוחות והמרתם לערכים מוגדרים מראש כמו קטגוריות ושדות בחירה.

  • הרצה מקומית על שרת קטן

    צריכת הזיכרון הנמוכה מתאימה לשרתים פנימיים בארגון שחייבים לשמור על פרטיות המידע.

איפה זה נופל

המודל הזה משתמש בארכיטקטורה הישנה יותר של משפחת Qwen לעומת הגרסאות הגדולות בסדרה, ולכן היכולות החזותיות שלו מוגבלות יותר מול מסמכים מורכבים במיוחד. המפתחים עצמם מודים שהוא עלול להתקשות במשימות עמומות או מורכבות, ומציעים להוסיף דוגמאות בתוך הבקשה כדי ליישר אותו למבנה הרצוי. בנוסף, אם תריצו אותו דרך סביבות כמו Ollama שמגיעות עם טמפרטורה של 0.7 כברירת מחדל, הדיוק שלו ייפגע קשות ותקבלו מבנים משובשים.

אותה משפחה

NuExtract-2.0 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה בחרו לבסס אותו על Qwen2-VL ולא על Qwen2.5-VL?

הגרסה הקטנה של סדרת 2.5 שוחררה תחת רישיון מחקרי שמגביל שימוש מסחרי. כדי לאפשר למפתחים להשתמש במודל קטן במוצרים אמיתיים בלי בעיות משפטיות, המפתחים העדיפו להישאר עם הבסיס הקודם שמחזיק ברישיון חופשי לחלוטין.

איך מבטיחים שהוא לא ימציא נתונים שלא קיימים במסמך?

בתבנית הנתונים ששולחים למודל אפשר להגדיר שדות מסוג verbatim-string שמאלצים אותו להעתיק אך ורק מחרוזות שמופיעות במקור מילה במילה. בנוסף, חובה להריץ אותו בטמפרטורה של אפס או קרוב מאוד לזה כדי למנוע ניחושים והזיות.

איך מריצים

בגלל הגודל הקטן, קבצי המשקולות תופסים כארבעה גיגה בייט בלבד, מה שמאפשר להריץ אותו בקלות על כרטיס מסך פשוט יחסית עם שמונה עד שנים עשר גיגה זיכרון. אפשר לטעון אותו ישירות דרך ספריית transformers או להרים שרת מקומי תואם תקן עם vLLM, כל עוד זוכרים להגדיר טמפרטורת ריצה קרובה לאפס כדי למנוע סטיות מהתבנית.

היוצרים מציעים גם גישה דרך שירות ענן בתשלום באתר שלהם. אם אין לכם כוח לנהל שרתים או אם אתם מעבדים נפחים נמוכים ומזדמנים, פנייה לשירות כזה תחסוך תחזוקה, אבל אם הנתונים רגישים או רצים בכמויות גדולות, הרצה עצמית כאן זולה ופשוטה מאוד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="numind/NuExtract-2.0-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שיש לכם חופש מלא. מותר להשתמש בו במוצרים מסחריים, לשנות אותו, להטמיע אותו בשרתים פרטיים או להפיץ אותו מחדש, בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗