GPT
N

NuExtract-1.5-tiny

קוד פתוח

numindmit2024-09-26

  • safetensors
  • qwen2
  • nlp
  • text-generation
  • conversational

numind עומדים גם מאחורי NuExtract 2.0 by NuMind, ויש עליו סקירה כאן.

חילוץ מידע מובנה ישירות לתוך תבנית JSON, מתוך מודל ששוקל פחות מג'יגה בודד. פתרון ממוקד למי שצריך לשלוף נתונים קונקרטיים מטקסט ארוך בלי לבזבז משאבי ענן.

  • 494Mפרמטרים
  • 32,768טוקנים בהקשר
  • 954 MBמשקל הקבצים
  • 6,024הורדות בחודש

מה זה

מדובר בכיוונון של Qwen2.5-0.5B שמיועד למשימה אחת בלבד: חילוץ מידע מובנה. אתם מעבירים לו טקסט ותבנית JSON ריקה, והוא מחזיר את הנתונים כשהם ממולאים. המודל בנוי כך שהוא כמעט ולא ממציא או מנסח מחדש, אלא גוזר את המילים המדויקות כפי שהן מופיעות במקור.

היתרון המרכזי כאן הוא שילוב של גודל וקונטקסט. המודל שוקל 954 מגה-בייט בלבד, אבל תומך בחלון הקשר של 32,768 טוקנים. הוא יודע לעבוד במספר שפות אירופיות, ביניהן אנגלית, צרפתית, ספרדית, גרמנית, פורטוגזית ואיטלקית. אם אתם צריכים רק לחלץ שדות מקובץ בלי לנתח או לקבל תשובות יצירתיות, הגודל הזעיר שלו נותן עבודה נקייה מאוד בלי משקל עודף.

מתאים ל

  • עיבוד חשבוניות וקבלות

    שליפת סכומים, שמות ספקים ותאריכים ישירות לתוך סכמת JSON מוגדרת מראש.

  • חילוץ פרטים ממסמכים ארוכים

    ניצול חלון של 32,768 טוקנים כדי לסרוק חוזים באנגלית ולשלוף סעיפים ספציפיים.

  • פייפליין מקומי במכשיר קצה

    משקל של פחות מג'יגה מאפשר הרצה מהירה מקומית באופליין בלי לפגוע בפרטיות.

איפה זה נופל

המודל מוגבל אך ורק לטקסט המקורי ולא יודע לסכם, לתרגם או לעשות מניפולציות על המידע. אם המידע לא כתוב מפורשות במסמך, הוא פשוט לא ישלוף אותו. בנוסף, רשימת השפות הנתמכות מוגדרת וסגורה לאנגלית ולכמה שפות אירופיות. עברית לא נכללת ברשימה הזו, ולכן לא הייתי בונה עליו לחילוץ מטקסטים בעברית לפני בדיקה יסודית של התוצאות.

שאלות
נפוצות

למה המודל ממציא לי שדות או לא מחזיר פלט יציב?

הוא רגיש מאוד להגדרות הדגימה. הכרטיס מדגיש שחייבים להריץ אותו בטמפרטורה שקרובה ל־0, אחרת הוא מתחיל לייצר טקסט חופשי במקום לחלץ.

האם הוא מתאים לעיבוד טקסטים בעברית?

המודל אומן ותועד רשמית רק עבור אנגלית, צרפתית, ספרדית, גרמנית, פורטוגזית ואיטלקית. עברית אינה ברשימה ולכן סביר להניח שיזייף או ייכשל במשימה.

איך מריצים

בגלל שמדובר בפחות מחצי מיליארד פרמטרים, כל מעבד סביר או כרטיס מסך בסיסי לחלוטין מריצים אותו בלי להרגיש. אין צורך בשרתים ייעודיים יקרים, והוא נכנס בקלות לזיכרון של מחשב נייד רגיל. חובה להגדיר טמפרטורה קרובה לאפס, כי בערכים גבוהים יותר כמו ברירות המחדל של כלים דוגמת Ollama, המודל מאבד את הדיוק בחילוץ.

ליוצרים יש גם גרסת 3.8B שמבוססת על ארכיטקטורה אחרת. אם הטקסטים שלכם מורכבים במיוחד ויש לכם שרת מתאים, שווה לבדוק אותה. אבל עבור משימות קבועות של חילוץ שדות, אין סיבה לשלם על API חיצוני כשאפשר להרים את הגרסה הזו מקומית באפס עלות שוטפת.

pip install -U huggingface_hub
hf download numind/NuExtract-1.5-tiny

הרישיון

רישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו במוצר סגור ולהפיץ אותו הלאה, בלי תמלוגים או דרישות לפתיחת הקוד. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית בתוך הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗