GPT
G

gemma-2-9b-it-GGUF

קוד פתוח

bartowskigemma2024-06-27

  • transformers
  • gguf
  • conversational
  • text-generation
  • endpoints_compatible

גרסת GGUF שעברה כיול imatrix למודל השיחה של גוגל בתשעה מיליארד פרמטרים. היא נועדה להרצה מקומית יעילה על מעבדים וכרטיסים גרפיים ביתיים.

  • 192 GBמשקל הקבצים
  • 26,556הורדות בחודש
  • 234לייקים

מה זה

המאגר הזה מציע המרות שונות של המודל המקורי מבית גוגל, שנבנו באמצעות llama.cpp עם כיול חשיבות מיוחד למניעת איבוד דיוק. המודל הבסיסי מגיע בגודל של תשעה מיליארד פרמטרים ומיועד ליצירת טקסט ושיחה. במקום להתעסק בהרצת משקלי פייתון כבדים, המבנה הזה מאפשר לפרוס את המודל ישירות על חומרה מקומית בקבצים בודדים.

הממיר, bartowski, ייצר כאן מגוון רחב של רמות דחיסה. יש כאן הכל, ממשקל מלא בפורמט של 36.97 ג'יגה בייט ועד גרסאות מכווצות של פחות מארבעה ג'יגה בייט. בחלק מהגרסאות, כמו Q6_K_L או Q4_K_L, שכבות ההטמעה והפלט נשמרות ברמת דיוק גבוהה של שמונה ביט כדי לשמור על איכות הפלט, בעוד שאר הרשת מכווצת יותר. זה נותן פתרון פרקטי למי שרוצה לשמור על איכות מענה גבוהה בלי לשלם בנפח זיכרון מוגזם.

מתאים ל

  • עוזר שיחה מקומי

    קובץ Q4_K_M רץ על כרטיס מסך צרכני פשוט ומספק מענה שוטף בלי לשלוח מידע לרשת.

  • מחשבים עם זיכרון נמוך

    גרסאות IQ3 מאפשרות לקבל ביצועי שיחה סבירים גם במכשירים עם פחות משישה ג'יגה ראם פנוי.

  • פיתוח ובדיקות אופליין

    הורדת קובץ בודד שמאפשרת לבחון אינטראקציות טקסט מקומית ללא תלות ברשת או בחיוב לפי טוקנים.

איפה זה נופל

המגבלה הכי בולטת שמופיעה בתיעוד היא חוסר תמיכה בהוראת מערכת מובנית. הפורמט דורש מעבר ישיר בין תור המשתמש לתור המודל בלבד, כך שכל הנחיית התנהגות חייבת להיכנס ישירות לתוך הודעת המשתמש. מעבר לזה, רמות הכיווץ הנמוכות מתחת לארבעה ביט מוגדרות באיכות נמוכה, ודחיסות כמו Q3_K_S לא מומלצות לשימוש שוטף.

אותה משפחה

gemma-2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להגדיר למודל תפקיד כללי דרך System Prompt?

לא. המודל אינו תומך בהוראת מערכת ייעודית. צריך להכניס את כל ההנחיות וההגדרות כחלק מההודעה הראשונה של המשתמש.

איזה קובץ הכי כדאי להוריד למחשב ביתי רגיל?

הגרסה המאוזנת ביותר היא Q4_K_M. היא שוקלת 5.76 ג'יגה בייט, שומרת על איכות טובה ומאפשרת ריצה חלקה על כרטיסים גרפיים נפוצים של שמונה ג'יגה.

איך מריצים

בשביל הרצה מהירה, כל המשקל צריך להיכנס לזיכרון כרטיס המסך, עם מרווח ביטחון של ג'יגה או שניים מעבר לגודל הקובץ. הגרסה הסטנדרטית שמומלצת לרוב האנשים היא Q4_K_M במשקל 5.76 ג'יגה בייט, שנכנסת בקלות לכרטיס עם שמונה ג'יגה זיכרון. אם יש לכם כרטיס חלש יותר ואתם נאלצים לרדת מתחת לרמת דחיסה של ארבעה ביט, עדיף לבחור בגרסאות ה־IQ, בתנאי שאתם עובדים עם אנבידיה או ROCm.

אם אתם רצים על מעבד רגיל או Metal במק, גרסאות ה־IQ יעבדו אבל יהיו איטיות יותר מגרסאות K מקבילות. במערכות מבוססות Vulkan גרסאות ה־IQ בכלל לא נתמכות. מי שצריך לשרת עשרות משתמשים במקביל או מחזיק מחשב בלי כרטיס מסך ייעודי, עדיף שיפנה ל־API בענן ולא ינסה לדחוף קבצים מכווצים מדי למעבד.

ollama run hf.co/bartowski/gemma-2-9b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון gemma של גוגל. מדובר בהסכם תנאי שימוש ייעודי שמאפשר שימוש במודל ובנגזרות שלו בכפוף למדיניות השימוש של גוגל, ולא ברישיון קוד פתוח סטנדרטי מסוג MIT או Apache. מי שמתכנן להפיץ את הקבצים או לשלב אותם במוצר מסחרי צריך לקרוא ולוודא עמידה בתנאי המקור של גוגל.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗