GPT
G

google_gemma-3-27b-it-qat-GGUF

קוד פתוח

bartowskigemma2025-04-18

  • gguf
  • gemma3
  • gemma
  • google
  • image-text-to-text

גרסת GGUF מכווצת למודל מולטימודלי של גוגל, שמיועדת לשמור על דיוק גבוה בכימות של 4 ביט הודות לאימון מותאם מראש.

  • 413 GBמשקל הקבצים
  • 2,229הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל שמקבל תמונה וטקסט ופולט טקסט, המבוסס על משקלי QAT שגוגל שחררה במקור עבור כימות ל־4 ביט. בדרך כלל, כימות פוסט-אימון פוגע בביצועים, אבל כאן המודל אומן מראש לצפות את אובדן המידע הזה, כך שהגרסאות המכווצות אמורות לשמור על יכולות קרובות למקור.

bartowski השתמש בגרסה b5147 של llama.cpp כדי להפיק מגוון רחב של כימותים, החל מ־bf16 מלא ועד IQ2 קיצוניים. המיוחד כאן הוא גרסת Q4_0, שמנצלת טכניקת אריזה מחדש של משקלים בזמן ריצה כדי לשפר מהירות על מעבדי ARM ו־AVX.

מתאים ל

  • ניתוח מסמכים ותמונות מקומי

    מאפשר לעבד קלטים ויזואליים יחד עם טקסט על חומרה מקומית בנפח של 16GB ומעלה.

  • הסקה מהירה על מעבדי שרת

    גרסת Q4_0 מותאמת להרצה מהירה במיוחד על גבי מעבדי AVX ו־ARM ללא צורך בכרטיס מסך יקר.

  • עבודה במערכות ללא ענן

    משלב יכולות מולטימודל מתקדמות בקובץ יחיד, בלי לשלוח מידע ונתונים לגורם צד שלישי.

איפה זה נופל

הקובץ היחיד שבאמת נהנה מיתרונות האימון הייחודי של גוגל הוא Q4_0. שאר הכימותים במאגר נוצרו כניסוי של הממיר, ולא מובטח שהם מתנהגים בצורה עקבית או עדיפים על כימות רגיל. בנוסף, לא מוצגים כאן מדדי דיוק ספציפיים להבנת תמונות בעברית, ולכן צריך לבדוק ידנית את איכות הראייה הממוחשבת ופיענוח הטקסט לפני שמסתמכים עליו.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

במקרה הספציפי הזה, Q4_0 הוא הבחירה הטבעית כי המודל המקורי אומן במיוחד עבורו. אם אתם רוצים את הפשרה הסטנדרטית שמתאימה לכרטיסי מסך, Q4_K_M מומלץ גם כן.

האם המודל ירוץ בצורה סבירה רק על המעבד?

כן, llama.cpp תומך בטעינה מחדש של המשקלים בגרסת Q4_0 בזמן ריצה, מה שמשפר את קצב יצירת הטוקנים על מעבדי AVX2 ו־ARM.

האם צריך להוריד את כל 413 הג'יגה-בייט שבעמוד?

ממש לא. מורידים רק קובץ GGUF בודד שמתאים לגודל הזיכרון שיש לכם במחשב או בשרת.

איך מריצים

אתם מורידים קובץ ספציפי מתוך המאגר ומריצים אותו מקומית דרך llama.cpp או LM Studio. אם יש לכם כרטיס מסך עם 24GB זיכרון, קבצי Q4 או Q5 כמו Q4_K_M במשקל 16.55GB ייכנסו במלואם וירוצו במהירות מקסימלית. מחשבים עם פחות זיכרון יצטרכו לרדת לכימותים אגרסיביים יותר כמו IQ3 או לפצל את הריצה לזיכרון המערכת.

אם אתם רצים על מעבדי שרתים כמו EPYC או מעבדי ARM ללא האצת כרטיס מסך ייעודי, גרסת Q4_0 תספק שיפור משמעותי במהירות עיבוד הפרומפט והפלט.

ollama run hf.co/bartowski/google_gemma-3-27b-it-qat-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

32 קבצים במאגר, 413 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון gemma של גוגל. הרישיון מאפשר שימוש מסחרי חופשי, כל עוד עומדים בתנאי השימוש ומדיניות הבטיחות של גוגל ומקפידים על ייחוס מתאים.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗