GPT
N

NuExtract3

קוד פתוח

numindapache-2.02026-04-29

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • vision-language

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

הוא מחלץ שדות מקבצים ותמונות ישירות למבנה JSON וממיר מסמכים לפורמט Markdown. מדובר בדגם קומפקטי שמכוון ספציפית לניתוח מסמכים במקום עוד צ'אטבוט רחב לשיחה כללית.

  • 4.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.7 GBמשקל הקבצים
  • 94,140הורדות בחודש

מה זה

הארכיטקטורה מבוססת על Qwen3.5 עם 4.5 מיליארד פרמטרים ומיועדת לעיבוד תמונה וטקסט יחד. במקום לבקש ממודל כללי לחלץ מידע ולקוות שהוא יחזיר מבנה תקין, מעבירים לו תבנית ספציפית שמגדירה מראש טיפוסים כמו מחרוזת מדויקת, תאריכים ומספרים. הוא מחזיר את המידע בדיוק לפי התבנית או פולט ערך ריק כששדה מסוים חסר.

במבחן פנימי של כ־600 מסמכים מגוונים שכללו חשבוניות ותוכניות מבנה, הוא השיג ציון דיוק ממוצע של 0.651 עם 27 כשלים בלבד בפיענוח הפלט. לשם השוואה, דגמים כמו Qwen3.5-4B או GLM-4.6V-Flash רשמו מעל 150 כשלים באותו מבחן. ההבדל נובע מכך שדגמים קטנים אחרים נכנסים ללולאות של חשיבה ממושכת, שורפים עשרות אלפי טוקנים ומגיעים למגבלת הפלט לפני שהם מפיקים תשובה.

מתאים ל

  • קליטת חשבוניות וקבלות

    הוא מחלץ שדות מוגדרים כמו סכום ותאריך ישירות לתוך מבנה נתונים מסודר.

  • המרת סריקות למרקראון

    הוא מזהה טקסט, הופך טבלאות לתגיות מתאימות ומשמר נוסחאות מתמטיות.

  • הכנת מסמכים לחיפוש

    הוא מנקה ומסדר קבצים מרובי עמודים לקראת הזנה למערכות אחזור מידע.

איפה זה נופל

הוא לא חסין מתקלות, וגם במבחן הביצועים של היוצרים שלו נרשמו 27 מסמכים שבהם הפלט לא היה בפורמט JSON קריא. כשהפעלת מצב החשיבה מופעלת, מודלים בגודל כזה עלולים להסתבך בלולאות טוקנים ארוכות במקום לגשת מיד למסמך. בנוסף, חילוץ מדויק תלוי באיכות הסריקה ובהגדרת התבנית הנכונה, כך שאי אפשר לצפות ממנו להבין קיצורים ייחודיים בלי לספק לו הוראות מפורטות או דוגמאות מראש.

אותה משפחה

NuExtract3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מגדירים לו איזה שדות לחלץ?

שולחים לו תבנית שמגדירה את המבנה המבוקש ואת סוג הערך של כל שדה, כמו מספר או תאריך. אם אין לכם מבנה קיים, אפשר להשתמש בספריית הקוד של החברה כדי להמיר מודל מובנה לתבנית, או לתת לו הוראה מילולית והוא ירכיב את המבנה בעצמו.

האם כדאי להשאיר את מצב החשיבה דולק תמיד?

עדיף לכבות אותו כברירת מחדל כדי לחסוך זמן ומשאבי עיבוד. מומלץ להפעיל את החשיבה רק כשמדובר במסמכים צפופים עם מבנה עמודה חריג, טפסים מקושקשים או שדות שדורשים הסקת מסקנות מההקשר הכללי.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.7 גיגה־בייט ב־bfloat16. כדי להריץ אותו דרך vLLM עם חלון הקשר סביר של מסמכים מרובי עמודים תצטרכו כרטיס מסך יחיד עם 16 או 24 גיגה־בייט של זיכרון תצוגה. הפקודה בשרת תומכת גם בשיטת פענוח ספקולטיבית לשיפור מהירות התגובה, ומאפשרת להפעיל שרת תואם ממשק OpenAI.

יש לו שני מצבי עבודה: מצב רגיל ומהיר למסמכים ברורים, ומצב שכולל שלב חשיבה למבנים מורכבים. אם התשתית שלכם מוגבלת או שאין לכם כרטיס תואם עם מספיק זיכרון לחלון הקשר מלא, פנייה לשירות ענן מנוהל תחסוך את כאב הראש של תחזוקת השרת.

from transformers import pipeline

pipe = pipeline("image-to-text", model="numind/NuExtract3")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המשקלים והפצה של המערכת בתוך מוצרים פנימיים או שירותים חיצוניים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים ועותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗