GPT
G

gemma-2-2b-it-GGUF

קוד פתוח

bartowskigemma2024-07-31

  • transformers
  • gguf
  • conversational
  • text-generation
  • endpoints_compatible

גרסת קוונטיזציה מכווצת למודל הקטן של גוגל שרצה ישירות על המעבד או על כרטיס מסך בסיסי. היא מתאימה למשימות טקסט מהירות במכשירים עם מעט מאוד זיכרון.

  • 27.3 GBמשקל הקבצים
  • 72,999הורדות בחודש
  • 102לייקים

מה זה

מדובר במודל שפת שיחה מכווץ בפורמט GGUF, שמבוסס על הגרסה הקטנה בסדרת Gemma 2 של גוגל ומיועד ליצירת טקסט ומענה להנחיות. המשקלים עברו עיבוד באמצעות llama.cpp עם כיול imatrix, מה שמאפשר להריץ אותם בסביבות מקומיות כמו LM Studio בלי להחזיק שרת ייעודי.

היתרון המרכזי כאן הוא גודל קובץ זעיר שמתחיל בכ־1.39GB בלבד בגרסאות הדחוסות ומגיע לכ־2.78GB בגרסת Q8_0, לצד קובץ משקלים מלא של 10.46GB. בנפחים כאלה אפשר להריץ מודל שפה מודרני אפילו על מחשבים ניידים פשוטים, בלי כרטיס גרפי ייעודי של אנבידיה. השוני מול מודלים קטנים אחרים מתבטא בארכיטקטורה של גוגל, שמצליחה לחלץ הבנה סבירה של הוראות גם ממעט מאוד פרמטרים.

מתאים ל

  • בוט מקומי על מחשב נייד

    קובץ של פחות מ־2GB מאפשר להריץ עוזר אישי מקומי בלי שרת ובלי חיבור אינטרנט.

  • תיוג וסיווג טקסט מהיר

    מענה מהיר וזול במשאבים למשימות מיון טקסטים קצרות שלא מצדיקות קריאה לענן.

  • סביבות קצה ומכשירי IoT

    משקל קל במיוחד בגרסאות ה־IQ מאפשר הפעלה על חומרה חלשה עם זיכרון RAM מינימלי.

איפה זה נופל

המגבלה הכי חשובה היא שהמודל לא תומך בכלל ב־System prompt. אי אפשר לקבוע לו אישיות או כללי התנהגות קבועים דרך השדה הזה, וכל ההנחיות חייבות להיכנס ישירות לתוך הודעת המשתמש לפי תבנית ה־prompt הספציפית שלו. מעבר לזה, מודל של שני מיליארד פרמטרים מתקשה בהסקה לוגית מפותלת, הוא נוטה לפספס דקויות ולא מתאים לכתיבת קוד מסובך.

אותה משפחה

gemma-2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק כדאי לי להוריד מתוך הרשימה?

עבור רוב השימושים, גרסת Q4_K_M מציעה את האיזון הטוב ביותר בין מהירות לגודל. אם הזיכרון שלכם מוגבל מאוד, אפשר לרדת ל־IQ3_M, ואם יש לכם מספיק זיכרון ואתם רוצים דיוק מרבי, לכו על Q6_K.

איך מגדירים למודל הוראות מערכת אם אין תמיכה ב־System prompt?

אתם חייבים להכניס את כל ההנחיות המקדימות ישירות לתוך פניית המשתמש הראשונה. הפורמט של המודל משתמש בתגיות פתיחה וסגירה קבועות של תורות שיחה, וצריך להקפיד עליהן כדי לקבל פלט יציב.

איך מריצים

אתם יכולים להוריד קובץ בודד בעזרת huggingface-cli או ישירות לתוך LM Studio. רוב המשתמשים יסתפקו בגרסת Q4_K_M ששוקלת 1.71GB ורצה חלק כמעט על כל חומרה מודרנית עם לפחות 4GB זיכרון פנוי. אם יש לכם כרטיס מסך של אנבידיה או מחשב מק, גרסאות ה־IQ כמו IQ3_M יתנו לכם חיסכון נוסף במקום, אבל כדאי לדעת שהן לא עובדות עם מאיצי Vulkan.

הרצה מקומית משתלמת כשרוצים אפס עלויות שוטפות, פרטיות מלאה ושליטה בלי תלות ברשת. אם המשימה שלכם דורשת ניתוח של מסמכים מורכבים במיוחד או שאתם צריכים לטפל באלפי פניות במקביל, שירות ענן חיצוני עדיין יעשה עבודה טובה ומהירה יותר.

ollama run hf.co/bartowski/gemma-2-2b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון gemma של גוגל. הוא מתיר שימוש מסחרי והפצה, אך כפוף למדיניות השימוש המקובל ותנאי ההסכם הספציפיים של גוגל למשפחת המודלים הזו, כך שחובה לוודא שהמוצר שלכם עומד בכללים שלהם לפני שאתם מפיצים אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗