GPT
I

Inkling-Small-GGUF

קוד פתוח

unslothapache-2.02026-07-30

  • gguf
  • conversational
  • image-text-to-text
  • audio-text-to-text
  • moe

ארכיטקטורת תערובת מומחים שמפעילה רק 12 מיליארד פרמטרים מתוך 276 בזמן אמת. מתאים למי שרוצה יכולות מולטימודליות של טקסט, תמונה ואודיו בלי לחנוק את החומרה.

  • 3.5 TBמשקל הקבצים
  • 1,391,243הורדות בחודש
  • 84לייקים

מה זה

מדובר במודל שמקבל פקודות טקסט, תמונות ואודיו, ומחזיר טקסט בפורמט UTF-8. הוא בנוי על ארכיטקטורת MoE עם 42 שכבות, שבה כל טוקן מנותב לשישה מתוך 256 מומחים ועוד שני מומחים משותפים. בפועל, למרות שיש לו 276 מיליארד פרמטרים בסך הכול, רק 12 מיליארד פעילים בכל רגע נתון. המבנה הזה נותן לו לשמור על מהירות תגובה סבירה בלי לוותר על הזיכרון הרחב של מודל ענק.

במדד AA Index v4.1 המודל מגיע לציון של 40.0 אחוז. המשמעות היא שהוא עוקף מודלים פתוחים גדולים ממנו כמו Qwen3.5 עם 397 מיליארד פרמטרים שקיבל 34 אחוז, ומשתווה ל־DeepSeek V4 Flash. מול מודלים סגורים הוא עוקף את Claude 4.5 Haiku שנעצר ב־30 אחוז, אבל עדיין מפגר בפער ברור מאחורי GPT 5.6 Luna שהגיע ל־49 אחוז.

מתאים ל

  • ניתוח תמונות והוראות טקסט

    מקודד התמונות ההיררכי מעבד תמונות עד 4096 פיקסלים לצד טקסט UTF-8 במודל יחיד.

  • עיבוד פקודות קוליות קצרות

    קולט קובצי אודיו WAV של עד 2 דקות ב־16kHz ומפיק פלט טקסטואלי ישיר.

  • עוזרי פיתוח ומערכות סוכנים

    נבנה עבור כלי קוד וסוכנים תוך הפעלת 12 מיליארד פרמטרים בלבד בכל טוקן.

איפה זה נופל

בגזרת האודיו המודל מוגבל טכנית, הוא דורש קובצי WAV בתדר 16kHz ומתפקד בצורה מיטבית רק בהקלטות קצרות משתי דקות. תמונות חייבות להיות בטווח של 40 עד 4096 פיקסלים. בנוסף, השליטה שלו בעברית נשענת על יכולות כלליות לשפות נוספות ולא על אופטימיזציה מקומית, כך שחובה לבדוק איכות פלט ותרגום לפני שמשלבים אותו במוצר שמיועד לקהל ישראלי.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד או תחנת עבודה רגילה?

לא. למרות שרק 12 מיליארד פרמטרים פעילים בכל טוקן, כל 276 מיליארד הפרמטרים חייבים לשבת בזיכרון. תצטרכו שרת ייעודי מרובה כרטיסי מסך, אפילו בגרסאות מכווצות של ביט בודד.

איך המודל מתמודד עם עברית?

הכרטיס מציין שהשפה העיקרית היא אנגלית ויש תמיכה רב־לשונית כללית בלבד. אין התאמה ספציפית לשפה העברית, ולכן צריך לבדוק אותו ישירות במשימות שלכם לפני שמסתמכים עליו.

האם חייבים להוריד את כל 3.5 הטרה־בייט שמופיעים במאגר?

ממש לא. המאגר מכיל עשרות גרסאות קוונטיזציה שונות בפורמט GGUF. מורידים רק את קובצי הגרסה הרצויה לחומרה שלכם, ולא את כל התיקייה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־3.5 טרה־בייט ב־115 קבצים בגלל מגוון גרסאות ה־GGUF, כולל קוונטיזציה של ביט בודד כמו UD-IQ1_S. כדי להחזיק מודל של 276 מיליארד פרמטרים בזיכרון תצטרכו שרת עם מספר כרטיסי מסך חזקים וזיכרון VRAM גדול מאוד, גם בגרסאות המכווצות. אם מריצים אותו מקומית, ספריות כמו vLLM, SGLang, TokenSpeed ו־Unsloth Studio מספקות תמיכה מובנית.

אם אין לכם אשכול שרתים ייעודי, עדיף בהרבה לקרוא לו דרך ה־API של ספקי צד שלישי או Tinker. המחיר המדווח לשירות עומד על 0.3 דולר למיליון טוקנים של קלט ו־1.2 דולר לפלט, זול משמעותית מעלות התחזוקה של חומרה כזאת.

ollama run hf.co/unsloth/Inkling-Small-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

115 קבצים במאגר, 3.5 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, כל עוד מצרפים את תנאי הרישיון והודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗