GPT
G

gemma-4-26B-A4B-it-heretic-GGUF

קוד פתוח

mradermacherapache-2.02026-04-04

  • transformers
  • gguf
  • heretic
  • uncensored
  • decensored

גרסת קוונטיזציה בפורמט GGUF למודל מבוסס Gemma בגודל 26B. מיועדת להרצה מקומית יעילה על חומרה צרכנית בלי להחזיק משקלים מלאים בזיכרון.

  • 170 GBמשקל הקבצים
  • 22,786הורדות בחודש
  • 55לייקים

מה זה

מדובר בהמרה של המודל gemma-4-26B-A4B-it-heretic לפורמט GGUF, שביצע mradermacher. המודל המקורי מגיע מתצורת instruction tuned באנגלית, וכאן הוא מוגש בסדרה של כיולים סטטיים שנועדו לחסוך מקום ולשפר ביצועים בהרצה מקומית. סך כל הקבצים שפורסמו במאגר תופס 170 גיגה בייט, אבל בפועל מורידים רק קובץ אחד שמתאים לחומרה שלכם.

הכרטיס לא מציג מבחני ביצועים ספציפיים למודל עצמו, אלא מפנה לגרפים כלליים על אובדן איכות בכיולים שונים. הקוונטים נעים בין Q2_K בגודל 10.7 גיגה בייט ועד Q8_0 שמגיע ל־27 גיגה בייט. מי שרוצה איזון טוב בין מהירות לאיכות ימצא המלצה מפורשת בכרטיס ללכת על Q4_K_M או Q4_K_S, בעוד רמות כמו Q3_K_M מסומנות כבעלות איכות נמוכה יותר.

מתאים ל

  • שרת הסקה מקומי

    הרצה מקומית באנגלית באמצעות llama.cpp על גבי כרטיס מסך עם 24 גיגה בייט זיכרון.

  • סביבת פיתוח ובדיקות

    בדיקת יכולות המודל והתנהגותו בגרסת Q4_K_M המומלצת לפני מעבר לחומרה כבדה.

  • עיבוד טקסט באנגלית ללא רשת

    שמירה על פרטיות מלאה של נתונים רגישים על ידי הרצה סגורה לחלוטין במחשב המקומי.

איפה זה נופל

הכרטיס מודה מראש שגרסאות מכוילות נמוכות, כמו Q3_K_M, סובלות מירידה באיכות הפלט. המודל מתועד רשמית באנגלית בלבד, כך שאין שום הבטחה או נתונים לגבי תמיכה בעברית. בנוסף, חסר כאן כל מידע על דאטהסט האימון המקורי, על חלון ההקשר המדויק או על בנצ'מרקים, ולכן חובה לבדוק הזיות והבנת הוראות לפני שמשלבים אותו במערכת אמיתית.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

היוצר מסמן במפורש את Q4_K_M ו־Q4_K_S כגרסאות מהירות ומומלצות, השוקלות 16.9 ו־15.6 גיגה בייט. אם יש לכם מספיק זיכרון ואתם רוצים איכות מקסימלית, Q8_0 ייתן את התוצאה הטובה ביותר אבל ידרוש 27 גיגה בייט.

האם המודל תומך בעברית?

השפה היחידה שרשומה במטא-דאטה היא אנגלית. ייתכן שהוא יבין מילים בודדות, אבל בלי תיעוד על אימון ייעודי עדיף לא לבנות עליו למשימות בעברית.

איך מריצים

כדי להריץ אותו צריך סביבה שתומכת בקובצי GGUF, כמו llama.cpp. קובצי ה־Q4 שוקלים סביב 16 עד 17 גיגה בייט, מה שאומר שצריך לפחות כרטיס מסך עם 24 גיגה בייט VRAM כדי לטעון אותם במלואם, או להסתמך על זיכרון מערכת משותף של מעבדי אפל. אם אתם עולים ל־Q6_K או Q8_0, תצטרכו 23 עד 27 גיגה בייט רק למשקלים, לפני שמחשבים את זיכרון ההקשר.

מי שאין לו כרטיס מסך מתאים עם מספיק זיכרון ייאלץ לספוג הרצה אטית מאוד על המעבד, ובמצב כזה עדיף לפנות ל־API חיצוני של מודל פתוח במקום להתעקש להריץ מקומית.

ollama run hf.co/mradermacher/gemma-4-26B-A4B-it-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הוא מתיר שימוש חופשי, שינוי קוד, והפצה לצרכים מסחריים ופרטיים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. זה מאפשר לשלב את המשקלים במוצר מסחרי בלי תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗