GPT
G

gemma-4-12B-it-GGUF

קוד פתוח

ggml-orgapache-2.02026-06-03

  • gguf
  • quantized
  • any-to-any
  • endpoints_compatible
  • conversational

גרסת GGUF מוכנה לשימוש עצמי שמביאה מודל של 12 מיליארד פרמטרים אל llama.cpp בלי כאבי ראש. אתם מקבלים שילוב של ביצועים טובים עם הרצה על מחשב מקומי סביר.

  • 42.5 GBמשקל הקבצים
  • 46,256הורדות בחודש
  • 85לייקים

מה זה

מדובר בהמרה רשמית של ggml עבור גרסת ההוראות של גוגל בגודל 12B, שמיועדת למשימות any-to-any לפי ההגדרות של המקור. הקבצים עברו תהליך המרה אוטומטי מבוסס הסקריפטים של הפרויקט, כך שהם מותאמים ישר לעבודה בתוך סביבות llama.cpp בלי שתצטרכו להמיר משקלים בעצמכם או להסתבך עם סביבות פייתון כבדות.

היתרון המרכזי של הגודל הזה הוא האיזון שהוא מציע בין יכולות חשיבה למשאבים. 12 מיליארד פרמטרים נותנים בדרך כלל מענה יציב בהרבה ממודלים של שבעה מיליארד, במיוחד במעקב אחרי הוראות מורכבות, ועדיין לא דורשים תחנת עבודה של שרתים ארגוניים כדי לעבוד בקצב סביר.

הכרטיס עצמו לא מציג מבחני ביצועים מספריים או השוואות רשמיות מול מתחרים. הוא מסתמך על שרשרת מודלי המקור של גוגל, כולל גרסאות שעברו אימון עזר וכיול קוונטיזציה ישיר, מה שאמור לספק בסיס חזק יותר כשמריצים את המשקלים המכווצים.

מתאים ל

  • עוזר פיתוח מקומי

    הרצת סוכן כתיבת קוד ישירות על המחשב בלי להוציא קוד פנימי לרשת.

  • עיבוד טקסט ומשימות שונות

    ביצוע משימות לפי הנחיות מוגדרות מראש תוך שימוש במבנה הגמיש של המודל.

  • שרת פנימי קל

    הקמת נקודת קצה פרטית בארגון בעזרת כלי השרת המובנה של llama.cpp.

איפה זה נופל

דף המודל דל מאוד בפרטים טכניים ולא כולל אזהרות שימוש, מידע על נתוני האימון או פירוט על איכות התמיכה בשפות שאינן אנגלית. בנוסף, המפרסמים ציינו בעצמם שהמידע בעמוד עדיין חסר ודורש השלמה, כך שחובה לבדוק אותו עצמאית מול מקרי הקצה שלכם לפני שסומכים עליו בפיתוח.

אותה משפחה

gemma-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 42.5 הגיגה בייט כדי להתחיל לעבוד?

לא, המשקל הכולל נובע מכך שהמאגר מכיל קבצים מפוצלים או גרסאות קוונטיזציה שונות. אתם צריכים להוריד רק את הקבצים של הגרסה הספציפית שמתאימה לנפח הזיכרון שלכם.

איך המודל הזה יתמודד עם עברית?

אין בתיעוד שום התייחסות לתמיכה בעברית או במשימות רב־לשוניות. תצטרכו להריץ כמה בדיקות עם טקסטים מקומיים כדי לראות אם התחביר והאוצר מילים מתאימים לדרישות שלכם.

איך מריצים

כדי להריץ אותו בפועל, פשוט מריצים פקודת שרת אחת של llama שמפנה ישירות לנתיב של המאגר ב־Hugging Face. כלל הקבצים שוקלים יחד 42.5 גיגה בייט ומחולקים ל־12 קבצים שונים, כך שצריך לוודא שיש לכם מספיק שטח אחסון פנוי ומספיק זיכרון עבודה כדי לטעון את המשקלים שאתם בוחרים.

אם יש לכם כרטיס מסך עם זיכרון צנוע מדי, המודל הזה עלול לזחול על המעבד. במצב כזה, או כשאין לכם עניין לנהל שרת מקומי, עדיף פשוט לצרוך את המודל דרך ספק API חיצוני ולא להעמיס על החומרה המקומית.

ollama run hf.co/ggml-org/gemma-4-12B-it-GGUF:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון כאן הוא apache-2.0, וזה אומר שאתם חופשיים להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו במוצרים שלכם. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי להטיל אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗