GPT
G

gemma-4-26B-A4B-it-heretic-GUFF

קוד פתוח

nohurryapache-2.02026-04-02

  • gguf
  • heretic
  • gemma4
  • gemma
  • google

גרסת קוונטיזציה למודל מולטימודלי שיודע לעבד תמונה וטקסט עם מנגנון חשיבה מובנה. מיועד למי שמחפש להריץ מקומית גרסה פתוחה וגמישה בלי תלויות בענן.

  • 361 GBמשקל הקבצים
  • 8,665הורדות בחודש
  • 74לייקים

מה זה

מדובר בהמרה של המודל coder3101/gemma-4-26B-A4B-it-heretic לפורמט GGUF תוך שימוש בכיול imatrix של Unsloth. המודל תומך בעיבוד תמונה לצד טקסט, ומכיל מנגנון הסקת מסקנות שאפשר להדליק או לכבות דרך הוספת תגית מתאימה בפרומפט המערכת. התנהגות כזו מאפשרת לשלוט על תקציב החשיבה לפני הפקת התשובה הסופית, דבר שחוסך משאבים וזמן תגובה.

המשקל הכולל של הקבצים בתיקייה מגיע ל־361 גיגהבייט בגלל פיצול למגוון רחב של רמות דחיסה וקובצי אנקודר לתמונה. המודל מתבסס על ארכיטקטורת Sliding Window Attention, מה שדורש הגדרות הפעלה ספציפיות כדי לא לפגוע באיכות הפלט וברציפות חלון ההקשר.

מתאים ל

  • ניתוח מסמכים ותמונות מקומי

    מאפשר לעבד תמונות וטקסט יחד על חומרה מקומית תוך שמירה על דיוק גבוה ברכיב הראייה.

  • כתיבה יוצרת עם שליטה בחשיבה

    כולל הגדרות דגימה ייעודיות לטקסט יצירתי ואפשרות לנטרל את שלב הניתוח המקדים לחלוטין.

  • פתרון בעיות מורכבות

    מפעיל בלוק חשיבה נפרד לקבלת נימוקים מעמיקים לפני כתיבת המענה הסופי.

איפה זה נופל

מנגנון הראייה רגיש מאוד לפגיעה של קוונטיזציה. מי שמתכנן לעבוד על משימות פענוח טקסט מתמונה יצטרך להימנע מדחיסה אגרסיבית של רכיב ה־mmproj ולבחור קבצים באיכות גבוהה, גם במחיר של ירידה ברמת הדיוק של מודל השפה עצמו. בנוסף, חובה לנהל את תקציב הטוקנים לחשיבה באופן ידני כדי שהמודל לא ייגרר לתהליכי חשיבה ארוכים מדי לפני שהוא מפיק מענה בפועל.

שאלות
נפוצות

איך מחשבים את דרישות הזיכרון להרצה?

החישוב מורכב ממשקל גרסת המודל שבחרתם, רכיב התמונה שנפחו כ־800 מגהבייט, וצריכת ההקשר שעומדת על גיגהבייט אחד לכל 8,192 טוקנים. בגרסת Q3_K_M עם 16K הקשר נדרשים כ־15.7 גיגהבייט VRAM.

איך שולטים במנגנון החשיבה של המודל?

כדי להפעיל את החשיבה יש להוסיף את התגית think בתחילת פרומפט המערכת. הסרת התגית מבטלת את התהליך, וניתן להגביל את תקציב טוקני החשיבה בהגדרות ההרצה.

איך מריצים

להרצה ב־llama.cpp או koboldcpp חובה להפעיל את הדגל swa-full כדי לטפל נכון בארכיטקטורת הקשב. לגבי זיכרון, המפתח מציג נוסחה פשוטה שבה כל 8,192 טוקנים של הקשר צורכים גיגהבייט אחד של VRAM, לצד משקל המודל וקובץ ה־mmproj שנפחו כ־800 מגהבייט. למשל, גרסת Q3_K_M עם הקשר של 16 אלף טוקנים תדרוש כ־15.7 גיגהבייט זיכרון גרפי.

אם אתם מחזיקים כרטיס מודרני מסדרת RTX 30 ומעלה או מעבדים עם תמיכת BF16, כדאי לבחור בגרסאות אלו. במערכות ישנות ללא האצה מתאימה, גרסאות F16 יעבדו בצורה חלקה יותר.

ollama run hf.co/nohurry/gemma-4-26B-A4B-it-heretic-GUFF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח במאגר הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה חופשית בקוד פתוח. יחד עם זאת, קיים בתיעוד קישור לרישיון gemma 4 של גוגל, מה שעלול ליצור אי בהירות משפטית לגבי תנאי השימוש הסופיים של משקלי הבסיס.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗