GPT
I

Inkling-NVFP4

קוד פתוח

thinkingmachinesapache-2.02026-07-14

  • transformers
  • safetensors
  • inkling_mm_model
  • image-text-to-text
  • conversational

מודל ענק שמקבל טקסט, תמונה ואודיו, ומחזיר טקסט. הוא מתאים למי שחייב משקולות פתוחות למערכות סוכנים רב-מודליות, ויש לו חומרה שיכולה להחזיק מעל חצי טרה-בייט בזיכרון.

  • 553Bפרמטרים
  • 551 GBמשקל הקבצים
  • 190,096הורדות בחודש
  • 91לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם 975 מיליארד פרמטרים בסך הכול, שמתוכם רק 41 מיליארד פעילים בכל טוקן. המשקל הספציפי הזה מכווץ לפורמט NVFP4, שמיועד לחסוך מקום בכרטיסי מסך תומכים תוך שמירה על ביצועים. המודל מעבד שמע בפורמט WAV עד 20 דקות, תמונות וטקסט לאותו מרחב פנימי.

במבחני קידוד וסוכנים כמו SWEBench Verified הוא מגיע ל־77.6%, שזה מעל מודלים פתוחים ישנים יותר אבל נמוך משמעותית ממודלים מסחריים סגורים שחוצים את ה־90%. ביכולת הכללית של מענה על עובדות הוא חלש יחסית, עם 43.9% בלבד ב־SimpleQA, מה שאומר שהוא ממציא לא מעט כשמבקשים ממנו פרטים יבשים.

מתאים ל

  • סוכן בדיקות ותיקון קוד

    תוצאה של 77.6% ב־SWEBench מאפשרת לו לנתח שגיאות בקוד ולהריץ פקודות בסביבת פיתוח סגורה.

  • תמלול וניתוח הקלטות ארוכות

    תמיכה מובנית בקובצי אודיו של עד 20 דקות חוסכת שימוש במודל נפרד להמרת קול לטקסט.

  • מערכות הפעלת כלים פנימיות

    עם 74.1% ב־MCP Atlas, הוא מתאים לחיבור מול ממשקי תוכנה ושרתים מקומיים בלי להוציא מידע החוצה.

איפה זה נופל

המודל סובל מבעיות אמינות קשות בידע כללי. הציון שלו במבחן AA Omniscience עומד על אחוז בודד, וב־SimpleQA הוא נופל מרוב המתחרים, כך שאסור להסתמך עליו כמקור לעובדות ללא שליפת מידע חיצונית. בנוסף, המפתחים מודים שהוא נוטה להיכנע לבקשות בעייתיות דרך משחקי תפקידים או ניסוחים עקיפים, ושהביצועים שלו דועכים בשיחות ארוכות עם הרבה תורות. אם אתם בונים ממשק שפתוח למשתמשי קצה, חובה להוסיף שכבת סינון כמו Llama Guard לפני ואחרי המודל.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

הוא אומן בעיקר על אנגלית אבל כולל יכולות רב-לשוניות כלליות. מאחר שהידע שלו בעובדות ורב-לשוניות לא נבדק לעומק בעברית, צפו לפער באיכות הטקסט בהשוואה לאנגלית, ותצטרכו לבדוק את התוצרים ידנית לפני שימוש אמיתי.

מה היתרון של גרסת ה־NVFP4 מול גרסת ה־BF16?

גרסת ה־NVFP4 דורשת משמעותית פחות זיכרון בכרטיסי מסך ותופסת פחות נפח אחסון. החיסרון הוא שצריך חומרה מודרנית שתומכת בהרצת חישובי FP4 בצורה יעילה כדי להרגיש את השיפור במהירות ההסקה.

איך מריצים

אתם צריכים אשכול שרתים רציני רק כדי לטעון אותו. הקבצים שוקלים 551 גיגה-בייט, כך שגם בגרסת ה־NVFP4 דרושים כמה כרטיסי H100 או B200 כדי להחזיק את המודל ולהריץ הסקה במהירות סבירה דרך ספריות כמו vLLM או SGLang.

גרסת ה־BF16 המלאה דורשת פי שניים זיכרון לפחות. לרוב המוחלט של הצוותים אין סיבה להקים תשתית כזאת לבד, ועדיף להשתמש ב־API של ספקים חיצוניים או ב־Playground של החברה, אלא אם הרגולציה או אבטחת המידע מחייבות התקנה מקומית סגורה לחלוטין.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="thinkingmachines/Inkling-NVFP4")
print(pipe("שלום"))

הקבצים

45 קבצים במאגר, 551 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 סטנדרטי. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו ולהטמיע אותו במוצרים סגורים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗