GPT
G

gemma-2-27b-it-GGUF

קוד פתוח

bartowskigemma2024-06-27

  • transformers
  • gguf
  • text-generation
  • endpoints_compatible
  • imatrix

גרסת קוונטיזציה של מודל ההוראות מבית גוגל שמאפשרת להריץ 27 מיליארד פרמטרים על חומרה מקומית בלי לאבד הרבה איכות, כל עוד יש לכם מספיק זיכרון להחזיק אותו.

  • 541 GBמשקל הקבצים
  • 5,841הורדות בחודש
  • 174לייקים

מה זה

מדובר בהמרה של המודל המקורי של גוגל לפורמט GGUF באמצעות הכלי llama.cpp, מה שנועד לאפשר הרצה על מעבדים גרפיים שולחניים או מערכות זיכרון משותף. כל הקבצים הוכנו בעזרת כיול imatrix שמטרתו לצמצם את הפגיעה בדיוק של המודל ביחס למשקלים המקוריים שלו, במיוחד בדחיסות אגרסיביות.

המודל מגיע בגודל של עשרים ושבעה מיליארד פרמטרים, נקודת אמצע בין משקלים קטנים של שבעה מיליארד למפלצות שדורשות אשכולות שרתים. הוא מיועד למשימות של יצירת טקסט ומענה להוראות, אבל להבדיל ממודלים אחרים ברמת המשקל הזו, המבנה שלו לא תומך בהנחיית מערכת נפרדת אלא רק בשיחה ישירה בין המשתמש למודל.

מתאים ל

  • עוזר מקומי למפתחים

    מתאים למי שרוצה מענה טכני מורכב על מחשב אישי חזק בלי לשלוח שורות קוד לשרת חיצוני.

  • עיבוד טקסט פרטי

    ניתוח מסמכים רגישים על שרת פנימי ללא גישה לרשת, תוך ניצול היכולת של 27 מיליארד פרמטרים.

  • צ'אט בוט פשוט לתמיכה

    ניהול שיחה במבנה ישיר של שאלות ותשובות, כל עוד אין צורך בהנחיות מערכת קבועות ומורכבות.

איפה זה נופל

הבעיה הבולטת ביותר כאן היא חוסר התמיכה בהנחיית מערכת, System prompt. אי אפשר להגדיר לו אישיות או מגבלות התנהגות קבועות מראש בפורמט הרגיל, אלא צריך להכניס הכל כחלק מההודעה של המשתמש. בנוסף, גרסאות ה־IQ החדשות לא תומכות בעיבוד דרך Vulkan, מה שמגביל משתמשים עם כרטיסי מסך מסוימים, ובגרסאות הנמוכות כמו שתי ביט איכות הטקסט נפגעת באופן מורגש.

אותה משפחה

gemma-2 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ מומלץ להוריד לשימוש כללי?

הקובץ Q4_K_M במשקל 16.65 גיגה מציע את האיזון הטוב ביותר בין מהירות לאיכות. הוא מתאים לכרטיסי מסך נפוצים עם מספיק זיכרון ולא דורש ירידה באיכות הטקסט.

איך שולחים לו הנחיה אם אין תמיכה בהנחיית מערכת?

עוטפים את ההוראות בתוך תגיות המשתמש הרגילות. במקום להגדיר תפקיד מראש, כותבים את כל הכללים והדרישות ישירות בתוך פקודת המשתמש הראשונה.

איך מריצים

כדי להריץ אותו צריך לבחור קובץ אחד מתוך האפשרויות, ולא להוריד את כל התיקייה. אם יש לכם כרטיס עם 24 גיגה זיכרון גרפי, גרסאות כמו Q4_K_M במשקל של 16.65 גיגה יעבדו בצורה חלקה וישאירו מקום להקשר. אם יורדים מתחת לארבעה ביטים, עדיף להשתמש בגרסאות ה־IQ כמו IQ3_M שמציעות איכות סבירה יותר ביחס לגודל של 12.45 גיגה.

ברגע שאין לכם כרטיס מתאים או שאתם צריכים להריץ מודלים במקביל למשתמשים רבים, עדיף לפנות לממשק רשת מנוהל. הרצה מקומית של מודל בגודל כזה על מעבד רגיל תהיה איטית מאוד ותדרוש זיכרון מערכת גדול כדי לא לקרוס.

ollama run hf.co/bartowski/gemma-2-27b-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים מופצים תחת רישיון gemma של גוגל. הרישיון הזה שונה מתוכנה חופשית רגילה והוא כולל תנאי שימוש ספציפיים שהחברה מגדירה, בעיקר סביב שימושים אסורים והגבלות על הפצה מחדש. אם אתם מתכננים לשלב אותו במוצר מסחרי, חובה לקרוא את נוסח הרישיון המקורי של גוגל ולוודא שהיישום שלכם לא מפר את הסעיפים שלו.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗