GPT
G

Gemma-2-9B-It-SPPO-Iter3-GGUF

קוד פתוח

bartowskigemma2024-06-30

  • gguf
  • text-generation
  • en
  • endpoints_compatible
  • conversational

גרסת GGUF שעברה כיול imatrix למודל Gemma 2 המכוונן בשיטת SPPO. היא מביאה איכות שיחה משופרת במבנה שמיועד לריצה מקומית על כרטיסי מסך ביתיים.

  • 154 GBמשקל הקבצים
  • 1,264הורדות בחודש
  • 57לייקים

מה זה

הבסיס כאן הוא Gemma 2 בגודל 9 מיליארד פרמטרים מבית UCLA-AGI, שעבר אימון העדפות בשיטת SPPO בסיבוב השלישי שלו. המטרה של התהליך הזה היא לחדד את התשובות ולהתאים אותן טוב יותר להנחיות של המשתמש ביחס לגרסת הבסיס הרגילה, תוך שמירה על גודל קומפקטי יחסית של תשעה מיליארד פרמטרים.

המפתח bartowski לקח את המשקלים האלה והמיר אותם לפורמט GGUF באמצעות llama.cpp בגרסה b3389. כל הקוונטיזציות כאן נוצרו בעזרת כיול imatrix, טכניקה שמשתמשת בדאטה־סט חיצוני כדי להקטין את איבוד המידע שנוצר בדחיסה. התוצאה היא מודל שיחה באנגלית שמצליח לשמור על היגיון ותחביר ברורים גם כשדוחסים אותו למשקלים נמוכים מאוד, בלי להתפרק במשימות מורכבות.

בניגוד למודלים מקבילים שדורשים שרתי ענק, כאן מקבלים יכולת ניסוח ויצירת טקסט של מודל מודרני בתוך חבילה שיכולה להיכנס כולה לזיכרון של כרטיס מסך אחד, מה שמאפשר זמן תגובה מהיר בלי תלות בחיבור רשת או ספקים חיצוניים.

מתאים ל

  • בוט שיחה אישי במחשב נייד

    משקל של פחות משישה גיגהבייט מאפשר להריץ עוזר אישי מקומי ופרטי לגמרי על כרטיס גרפי ביתי.

  • עיבוד וסיכום טקסט באנגלית

    כוונון ה־SPPO משפר את הדיוק במעקב אחרי הנחיות יצירה, עריכה וניתוח טקסטים ארוכים באנגלית.

  • הרצה מקומית על חומרה חלשה

    גרסאות ה־IQ המכווצות יורדות עד 3.43 גיגהבייט ומאפשרות תגובה סבירה גם כשנפח הזיכרון מוגבל.

איפה זה נופל

המגבלה הכי קריטית שצריך לשים לב אליה היא היעדר תמיכה בהנחיית מערכת, System prompt. הפורמט עובד רק בתורות מוגדרים של משתמש ומודל, כך שאם המוצר שלכם מסתמך על הזרקת הוראות התנהגות קבועות בתחילת השיחה, תצטרכו להדביק אותן ישירות בתוך פניית המשתמש הראשונה. בנוסף, המודל מיועד ומכויל לאנגלית בלבד, וגרסאות הדחיסה מסוג I-quants לא עובדות טוב עם Vulkan ומאטות מאוד על מעבדים ועל שבבי אפל.

שאלות
נפוצות

איך מגדירים לו התנהגות בלי System prompt?

דוחפים את הוראות ההתנהגות ישירות לתוך ההודעה הראשונה של המשתמש. התבנית הרשמית תומכת רק בתגיות user ו־model, כך שכל ניסיון להגדיר תפקיד מערכת ייצור שגיאות או פלט מקולקל.

איזה קובץ להוריד מתוך הרשימה הענקית?

לרוב המשתמשים מומלץ לקחת את Q4_K_M שנותן יחס מעולה בין איכות לגודל של 5.76 גיגהבייט. אם יש לכם זיכרון מוגבל במיוחד בחרו ב־IQ4_XS או IQ3_M, ואם יש לכם כרטיס חזק לכו ישר על Q6_K.

האם המודל יפעל טוב עם פרומפטים בעברית?

הכרטיס מציין תמיכה בשפה האנגלית בלבד. הוא מסוגל לקלוט מילים בעברית ברמה בסיסית מאוד, אבל התחביר והתשובות ישברו בקלות, ולכן עדיף להגביל את השימוש בו לאנגלית.

איך מריצים

בשביל להריץ אותו במהירות מקסימלית צריך לטעון את כל הקובץ לזיכרון כרטיס המסך, כלומר ל־VRAM. הגרסה המאוזנת לרוב האנשים היא Q4_K_M ששוקלת 5.76 גיגהבייט ודורשת כרטיס מסך עם לפחות 8 גיגהבייט זיכרון כדי להשאיר מקום להקשר. אם יש לכם כרטיס עם 12 גיגהבייט או 16 גיגהבייט, אפשר לעלות לגרסאות Q6_K או Q8_0 שמגיעות עד 9.83 גיגהבייט ונותנות דיוק כמעט מושלם.

הקבצים נעים בין 3.43 גיגהבייט בגרסת IQ2_M ועד 36.97 גיגהבייט בגרסת f32 המלאה. אם המחשב שלכם חלש מדי ואתם יורדים מתחת ל־Q4, עדיף לבחור בגרסאות ה־I-quants כמו IQ3_M שמציעות ביצועים עדיפים לגודל שלהן בחומרה תומכת. במידה ואין לכם כרטיס ייעודי ואתם נאלצים לזרוק הכל על מעבד רגיל, כנראה שעדיף לשלם לפי שימוש ל־API של מודל סגור.

ollama run hf.co/bartowski/Gemma-2-9B-It-SPPO-Iter3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון gemma של גוגל. מותר להשתמש בו לצרכים מסחריים ופיתוח פנימי, אבל השימוש כפוף למדיניות השימוש וההגבלות המשפטיות שגוגל מגדירה לתנאי ההפצה של משפחת המודלים הזו, ולא מדובר ברישיון קוד פתוח חופשי לחלוטין כמו MIT או Apache.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗