GPT
I

inkling-GGUF

קוד פתוח

unslothapache-2.02026-07-14

  • gguf
  • conversational
  • image-text-to-text
  • audio-text-to-text
  • moe

מודל ענק שמקבל טקסט, תמונה ואודיו יחד ומחזיר טקסט. הוא מתאים למי שחייב משקולות פתוחות למשימות מולטימודליות כבדות ומוכן להתמודד עם גודל חריג.

  • 4.2 TBמשקל הקבצים
  • 657,216הורדות בחודש
  • 135לייקים

מה זה

מדובר בארכיטקטורת MoE עם 975 מיליארד פרמטרים בסך הכול, שמתוכם 41 מיליארד פעילים בכל טוקן דרך שישה מומחים ייעודיים ושניים משותפים. המודל מעבד שמע בפורמט WAV עד עשרים דקות ותמונות ברזולוציה של עד 4096 פיקסלים, כשהכול מוזן ישירות לאותו מרחב נסתר בלי שכבות תיווך נפרדות.

במבחני ביצועים הוא מציג יכולת מרשימה במתמטיקה עם 97.1% ב־AIME 2026, אבל במשימות קוד וסוכנים כמו SWEBench Verified הוא נעצר ב־77.6%, נמוך משמעותית ממודלים סגורים מובילים. הוא אמנם מנצח חלופות פתוחות מסוימות במבחני ראייה ושמע, אך במבחני עובדות וידע כללי הוא מתקשה להציג יציבות יוצאת דופן.

מתאים ל

  • ניתוח משולב של שיחות קוליות

    קליטת הקלטות אודיו באורך עד עשרים דקות יחד עם תמונות מסך להפקת דוחות טקסטואליים.

  • פתרון בעיות מתמטיקה ומדעים

    התמודדות עם שאלות חישוב מורכבות בזכות תוצאה של 97.1% במבחן AIME 2026.

  • סוכן בדיקות ממשק וקוד מקומי

    שילוב מערכות של הרצת פקודות טרמינל ובדיקת קבצים בארגונים שאינם מורשים להוציא מידע לענן.

איפה זה נופל

הדיוק העובדתי שלו בעייתי למדי, עם 43.9% בלבד ב־SimpleQA Verified ותוצאה כמעט אפסית ב־AA Omniscience, מה שמעיד על נטייה להזיות. בריצה לטווח ארוך הביצועים שלו נשחקים בשיחות מרובות שלבים, ובנוסף קיים סיכון לעקיפת מנגנוני הבטיחות דרך משחקי תפקידים או ניסוחים עקיפים. הכרטיס עצמו מדגיש שחובה להוסיף כלי סינון כמו Llama Guard ולא להסתמך עליו בתחומי רפואה או משפט.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־GGUF הזו על מחשב פיתוח רגיל?

לא. למרות שמדובר בפורמט GGUF ובקוונטיזציה נמוכה, המשקל הכולל של הפרמטרים מגיע ל־975 מיליארד. תזדקקו לשרת ייעודי מרובה מאיצים גרפיים ונפח זיכרון עצום רק כדי לטעון אותו לזיכרון.

האם המודל מתאים ליישומים שדורשים דיוק עובדתי גבוה?

לא מומלץ להסתמך עליו ללא מקור מידע חיצוני. התוצאות שלו במבחני עובדות נמוכות יחסית, והמפתחים מודים שהוא נוטה להזיות ולדעיכה באיכות התשובות לאורך שיחות ארוכות.

איך מריצים

הריפו כולל קובצי GGUF במשקל כולל של 4.2 טרה בייט שמחולקים ל־109 קבצים, כולל גרסאות קוונטיזציה קיצוניות כמו ביט בודד UD-IQ1_S. גם בגרסאות מכווצות מאוד, להריץ מודל של כמעט טריליון פרמטרים דורש אשכול שרתים רציני עם מאות גיגה בייט של זיכרון, בספריות כמו vLLM, SGLang או Unsloth Studio.

אם אין לכם תשתית ענן ייעודית עם כרטיסי H100 מרובים ותקציב חומרה כבד, אין טעם להוריד את הקבצים האלה פיזית. עדיף בהרבה להשתמש ב־API של ספקי צד שלישי שמארחים את המודל, אלא אם קיימת דרישת אבטחה מחמירה שמחייבת התקנה מקומית מוחלטת.

ollama run hf.co/unsloth/inkling-GGUF:Q4_K_XL

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

109 קבצים במאגר, 4.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה מחדש בלי תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שתפיצו במוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗