GPT
L

LFM2-350M-Extract

קוד פתוח

LiquidAIother2025-09-03

  • transformers
  • safetensors
  • lfm2
  • text-generation
  • liquid

מודל זעיר שמחלץ מידע מטקסט חופשי ומחזיר JSON, XML או YAML. הוא שוקל פחות מג'יגה וחצי, תומך בהקשר ענק של 128,000 טוקנים ומיועד לחילוץ נתונים מדויק במקום מודל ענק.

  • 354Mפרמטרים
  • 128,000טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 1,170הורדות בחודש

מה זה

מדובר במודל של 354 מיליון פרמטרים שאומן על נתונים סינתטיים למטרה אחת בלבד, לקחת טקסט לא מובנה ולשלוף ממנו שדות לפי סכמה מוגדרת. הוא תומך בשמונה שפות מלבד אנגלית, כולל ערבית, צרפתית וספרדית, אבל עברית לא נמצאת ברשימה.

לפי הבדיקות של LiquidAI מול 5,000 מסמכים, המודל עקף את Gemma 3 4B בדיוק התחבירי ובנאמנות לטקסט המקורי, אף שהוא קטן ממנו ביותר מפי 11. זה אומר שבמקום לשלם על מודל שפה כללי שינחש את מבנה הפלט, מקבלים מודל ממוקד שפולט מבנה תקין בעקביות גבוהה.

מתאים ל

  • חילוץ חשבוניות מקבצים

    ממיר תוכן מיילים וטקסטים למבנה JSON מסודר לפי סכמה.

  • ניתוח פניות תמיכה

    שולף פרטי לקוח וסיווג תקלה ישירות לפורמט YAML עבור צנרת נתונים.

  • המרה של דוחות רגולציה

    מעבד טקסטים ארוכים מתוך חלון של 128 אלף טוקנים ומייצר XML תקין.

איפה זה נופל

המודל מיועד לשיחה בתור יחיד בלבד, single-turn, ואי אפשר לנהל איתו דיאלוג מתמשך. אם תנסו להשתמש בו לשיחה רגילה או לכתיבה יוצרת, הוא פשוט לא בנוי לזה. מעבר לכך, האימון התבסס ברובו על מידע סינתטי, כך שבטקסטים מפותלים מאוד מהעולם האמיתי צריך לבדוק אותו היטב.

החיסרון המרכזי כאן הוא היעדר תמיכה בעברית. המודל לא נבדק או אומן על עברית, ולכן לא הייתי מסתמך עליו לעיבוד מסמכים מקומיים בלי בדיקה קפדנית מראש של הפלטים.

אותה משפחה

LFM2-350M-Extract יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד טוב על מסמכים בעברית?

המודל לא כולל עברית ברשימת השפות הנתמכות, שכוללת שפות כמו אנגלית, ערבית, צרפתית וספרדית. סביר להניח שהוא יתקשה בהבנת הטקסט ויוציא שגיאות בחילוץ הנתונים. אם המסמכים שלכם בעברית, תצטרכו לבצע בדיקות מקדימות או לשקול פתרון אחר.

איך מבטיחים שהפלט יחזור בפורמט הרצוי בלי שגיאות?

מגדירים פרומפט מערכת עם הסכמה הנדרשת וסוג הפורמט, כמו JSON, XML או YAML. בנוסף, חובה להריץ את המודל בטמפרטורה 0 כדי למנוע יצירתיות וסטיות מהמבנה שהוגדר.

איך מריצים

המודל שוקל 1.3 גיגה בייט בלבד, כך שאפשר להריץ אותו בקלות על מעבד רגיל, לפטופ פשוט או כרטיס מסך בסיסי עם מעט מאוד זיכרון. מריצים אותו דרך ספריית transformers הרגילה, ויש לו גם גרסאות GGUF מותאמות לשימוש עם llama.cpp למי שרוצה ביצועים טובים יותר מקומית.

בזמן ההרצה חובה להגדיר temperature=0 לקבלת תוצאות דטרמיניסטיות. אם אתם צריכים רק לחלץ שדות מקבצים בודדים פעם ביום, פנייה ל־API קיים תחסוך תחזוקה, אבל כשצריך לעבד כמויות של מסמכים מקומית או בתוך תשתית מאובטחת, המשקל הקטן שלו הופך הרצה עצמית להחלטה פשוטה.

from transformers import pipeline

pipe = pipeline("text-generation", model="LiquidAI/LFM2-350M-Extract")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other, כלומר רישיון מותאם אישית של LiquidAI ולא רישיון קוד פתוח סטנדרטי כמו MIT או Apache. המשמעות היא שחובה לקרוא את תנאי השימוש הספציפיים באתר החברה לפני שמשלבים אותו במוצר מסחרי, ולא להניח שהשימוש חופשי לגמרי.

הרישיון המלא בעמוד המודל ↗