GPT
M

maple-preview-GGUF

קוד פתוח

deepgrovemit2026-08-06

  • transformers
  • gguf
  • causal-lm
  • mixture-of-experts
  • reasoning

גרסת GGUF של מודל חשיבה עם תמיכה בכימות טרנארי קיצוני, שתוכננה לרוץ מהר ישירות על המעבד בלי לדרוש מאיץ גרפי ייעודי.

  • 21.1 GBמשקל הקבצים
  • 443,361הורדות בחודש
  • 62לייקים

מה זה

מדובר במימוש של מודל מסוג Mixture of Experts בגודל 20B פרמטרים, אבל רק כמיליארד מהם פעילים בכל טוקן (256 מומחים, 8 פעילים). המבנה הזה נבנה מראש להסקה חסכונית במכשירים מקומיים, תוך שילוב של מנגנוני קשב מקומיים וגלובליים כדי להוריד עומס חישובי.

הייחוד האמיתי כאן הוא הכימות הטרנארי. המשקלים מכווצים לרמות של TQ1_0 או TQ2_0, בעוד שראש המודל נשאר מדויק יותר ב־Q4_K או FP16 כדי לא לחרב את הפלט. בבדיקות על מעבד M5 Pro בלבד, גרסת TQ2_0 עם ראש Q4_K מגיעה לקצב פלט מרשים של מעל 250 טוקנים לשנייה, מה שמראה שאפשר לקבל מהירות עצומה גם בלי כרטיס מסך חזק.

מתאים ל

  • הסקה ישירה על מחשב נייד

    מאפשר עיבוד חשיבה מהיר על מעבד בלבד, בלי צורך בכרטיס מסך מפלצתי.

  • פתרון בעיות לוגיות מקומי

    הארכיטקטורה מותאמת למשימות חשיבה גולמיות ורצות מהר מאוד בכימות טרנארי.

  • סביבות פיתוח מנותקות רשת

    שוקל סביב חמישה גיגהבייט ורץ כולו בזיכרון המערכת ללא תלות בענן.

איפה זה נופל

היוצרים מבהירים שמדובר בגרסת תצוגה מקדימה שמתמקדת נטו בהסקה וחשיבה גולמית. היא מוגדרת רשמית כחלשה במשימות של סוכנים, כלים וקריאות לפונקציות, כך שלא כדאי לבנות עליה לאוטומציות מורכבות. בנוסף, המודל אומן ותועד באנגלית בלבד, וסביר להניח שהעברית שלו שבורה או לא קיימת בכלל.

אותה משפחה

maple יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יכול להחליף מנוע לסוכני AI?

לא. הכרטיס מצהיר מפורשות שגרסת התצוגה המקדימה הזו חלשה במבחני סוכנים. היא מתאימה לחשיבה ועיבוד טקסט גולמי, לא לשימוש בכלים או הפעלת מערכות חיצוניות.

אפשר להריץ אותו עם הגרסה הרשמית של llama.cpp?

כרגע לא מומלץ לנסות. הפרויקט דורש מזלג ייעודי של llama.cpp שפרסמה deepgrove כדי לתמוך בשיטות הכימות TQ1_0 ו־TQ2_0. אם תנסו להריץ אותו בתוכנה רגילה שלא מכירה את הפורמט, הקובץ פשוט לא ייטען.

איך מריצים

כדי להריץ אותו צריך להוריד את המזלג המותאם של llama.cpp שפרסמו deepgrove, כי הגרסאות הרשמיות לא בהכרח תומכות בפורמט הטרנארי הספציפי הזה. מבחינת נפח, הקבצים שוקלים בין 4.64GB ל־5.91GB, כך שכל לפטופ מודרני עם 8GB או 16GB זיכרון יחזיק אותם בקלות על ה־RAM הרגיל.

אם יש לכם מעט זיכרון פנוי לכו על TQ1_0, אבל אם המטרה היא מהירות יצירה מקסימלית, TQ2_0 מציג ביצועים עדיפים של עד 252 טוקנים לשנייה על מעבד חזק. שווה להחזיק אותו מקומית אם רוצים מהירות פלט גבוהה בלי עלויות ענן, אבל אם אתם צריכים אינטגרציה סטנדרטית בלי לתחזק גרסאות קוד מותאמות, פנייה ל־API חיצוני תחסוך כאב ראש.

ollama run hf.co/deepgrove/maple-preview-GGUF:F16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר ברישיון MIT חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות את הקבצים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים בלי תמלוגים, כל עוד שומרים על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗