GPT
I

Inkling-Small-NVFP4

קוד פתוח

thinkingmachinesapache-2.02026-07-27

  • transformers
  • safetensors
  • inkling_mm_model
  • image-text-to-text
  • conversational

גרסת קוונטיזציה דחוסה של מודל מולטימודלי עצום, שמקבלת תמונות ואודיו לצד טקסט. היא מיועדת למי שרוצה ביצועי קוד וסוכנים חזקים בלי להקצות שרת שלם לדיוק מלא.

  • 156Bפרמטרים
  • 159 GBמשקל הקבצים
  • 211,996הורדות בחודש
  • 79לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם 42 שכבות שבהן 6 מומחים מתוך 256 פעילים לכל טוקן, יחד עם שני מומחים משותפים. בפועל רצים 12 מיליארד פרמטרים על כל טוקן מתוך נפח כולל שנרשם כ־276 מיליארד. המודל מעבד טקסט, קובצי תמונה וקובצי אודיו בפורמט WAV ישירות אל תוך מרחב נסתר משותף, ומחזיר טקסט בלבד.

במדדי קוד וסוכנים הוא מציג מספרים יוצאי דופן. הוא הגיע ל־80.2 אחוזים במבחן SWEBench Verified ול־55.9 אחוזים בגרסת הפרו של המבחן, תוצאות שעוקפות מודלים פתוחים כבדים ממנו בהרבה. במבחני שימוש בכלים כמו MCP Atlas הוא עומד על 79.6 אחוזים, כך שמדובר במנוע שמכוון באופן מובהק לאוטומציות, הרצת פקודות מסוף ופתרון באגים אמיתיים בריפוזיטורי.

מתאים ל

  • סוכן בדיקות ותיקון קוד

    הוא משיג 80.2 אחוזים ב־SWEBench Verified, ציון שמתאים במיוחד לפתיחת תיקונים אוטומטיים בריפו.

  • הפעלת פקודות מסוף

    עם 64.7 אחוזים ב־Terminal Bench 2.1 הוא מסוגל לתפעל סביבות פיתוח וממשקי שורת פקודה.

  • חיבור לממשקי MCP

    ציון של 79.6 אחוזים במבחן MCP Atlas הופך אותו לבחירה טבעית לשילוב עם כלים חיצוניים.

איפה זה נופל

במשימות רב שלביות של בנקאות ושירות כמו Tau 3 Banking המודל צונח ל־15.5 אחוזים בלבד. קובצי האודיו מוגבלים בפועל לאורך של עד שתי דקות ובקצב דגימה מדויק של 16 קילוהרץ כדי לקבל תוצאות טובות. מעבר לכך, בכרטיס המודל מצוין במפורש שנדרש אימות עצמאי, ולא ברור מה רמת השליטה שלו בעברית שכן הוא נבדק בעיקר באנגלית.

שאלות
נפוצות

האם המודל ירוץ על כרטיס גרפי ביתי רגיל?

לא. המשקל של הקבצים מגיע ל־159 גיגה בייט בפורמט NVFP4, כך שכרטיס בודד רגיל לא יצליח אפילו לטעון אותו לזיכרון. תצטרכו חומרה ייעודית שתומכת בפורמט הדחיסה הזה עם כמות זיכרון גרפי גדולה מאוד.

איזה קלט מולטימודלי המודל מקבל?

הוא מקבל טקסט בקידוד UTF-8, תמונות ברזולוציה שבין 40 ל־4096 פיקסלים, וקובצי אודיו בפורמט WAV עד שתי דקות. הפלט שהוא מחזיר הוא תמיד טקסט בלבד ולא קול או תמונות.

מה ההבדל בין גרסה זו לגרסת BF16?

גרסה זו מומרת לדיוק של ארבעה ביט לפי התקן של אנבידיה כדי לחסוך מקום ומשאבי ריצה. אם אין לכם חומרה ייעודית שתומכת ב־NVFP4, תצטרכו להסתכל על גרסת ה־BF16 המלאה או להשתמש ב־API.

איך מריצים

המשקל הכולל של הקבצים עומד על 159 גיגה בייט בפורמט NVFP4. כדי לארח אותו עצמאית תצטרכו שרת עם מאיצים תומכי קוונטיזציה של ארבעה ביט ונפח זיכרון גרפי משמעותי, שכן מדובר עדיין במודל כבד שמחולק על פני 21 קבצים. ספריות כמו SGLang, vLLM ו־Unsloth כבר כוללות מתכונים להרצה מקומית שלו.

אם אין לכם קלאסטר מתאים של חומרה חדשה שתומכת בפורמט ה־FP4 של אנבידיה, עדיף להשתמש ב־API דרך ספקי צד שלישי או דרך ה־Cookbook של החברה. אין שום היגיון כלכלי ברכישת חומרה כזו רק לבדיקות היתכנות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="thinkingmachines/Inkling-Small-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 תקני. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, בכפוף לציון הקרדיט ושמירה על תנאי הרישיון המקוריים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗