GPT
G

guanaco-65B-GPTQ

קוד פתוח

TheBlokeother2023-05-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-generation-inference

גרסת מכווצת של Guanaco בוגר בגודל 65 מיליארד פרמטרים. היא נועדה למי שרוצה להריץ שיחה ברמה גבוהה מקומית על כרטיסי מסך בלי להחזיק שרת כפול.

  • 65Bפרמטרים
  • 2,048טוקנים בהקשר
  • 31.2 GBמשקל הקבצים
  • 357הורדות בחודש

מה זה

מדובר במודל שיחה שנוצר ממיזוג של LoRA על בסיס מודל בקוד פתוח של 65 מיליארד פרמטרים, ונארז כאן מחדש בכימות של 4 ושל 3 ביט. המטרה היא לקחת את המשקל הכבד של מודל ענק ולהביא אותו לריצה מעשית דרך AutoGPTQ או ExLlama.

ההבדל מול מודלים קטנים יותר מורגש ביכולת לעקוב אחרי הוראות שיחה מדויקות לפי הפורמט של Human ושל Assistant. הכרטיס לא מציג תוצאות מדידה מספריות של ביצועים, כך שקשה לדעת במדויק איך הכימות השפיע על ההיגיון שלו ביחס למקור.

מתאים ל

  • עוזר שיחה מקומי

    מתאים לשרתי שיחה פנימיים שבהם המידע לא יכול לצאת לרשת, בזכות גודל 65B שנכנס לכרטיס גרפי יחיד.

  • מענה לפי תבנית קבועה

    מגיב היטב להוראות בפורמט מובנה של Human ושל Assistant עבור משימות ניסוח.

  • הרצה מהירה ב־ExLlama

    גרסאות ה־4 ביט מותאמות לעבודה עם ExLlama לקבלת קצב הפקה גבוה בחומרה תואמת.

איפה זה נופל

חלון ההקשר מוגבל ל־2048 טוקנים בלבד, מה שמקשה מאוד על שיחות ארוכות, ניתוח מסמכים שלמים או קריאת קטעי קוד נרחבים. בנוסף, המודל אומן על נתונים באנגלית ואין שום מידע על תמיכה או ביצועים בעברית, כך שסביר להניח שהוא יתקשה בשפה המקומית. מעבר לכך, יוצר המודל המקורי לא סיפק כרטיס מודל מלא, ולכן אין מידע על מגבלות אבטחה או הטיות שנבדקו.

אותה משפחה

guanaco יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסת קובץ כדאי להוריד מהמאגר?

אם יש לכם מקום בזיכרון, גרסת 4bit עם קבוצה של 32 ו־act order תיתן את איכות הטקסט הגבוהה ביותר מבין האפשרויות. לחיסכון במקום עדיף לבחור בגרסת 128g או בגרסאות ה־3 ביט, אם כי הן יורדות ברמת הדיוק.

האם אפשר להריץ את המודל דרך ממשק גרפי?

כן, המאגר מותאם לעבודה ישירה מול text-generation-webui. אפשר להוריד את הקבצים ישירות דרך לשונית הדגמים בממשק ולטעון אותם אוטומטית בעזרת קובץ ההגדרות המצורף.

איך מריצים

כדי להריץ אותו תצטרכו כרטיס גרפי שתומך בנפח של קובצי המודל, שנעים בין 25.39 גיגה בייט בגרסת 3 ביט לבין 38.53 גיגה בייט בגרסת 4 ביט עם act order. כל הגרסאות של 4 ביט תואמות לריצה מהירה דרך ExLlama, בעוד שגרסאות ה־3 ביט לא נתמכות שם ומחייבות שימוש ב־AutoGPTQ.

ההתקנה דורשת סביבת פייתון עם transformers, חבילת optimum וספריית auto-gptq. אם אין לכם חומרה ייעודית עם מספיק זיכרון וידאו להחזיק מעל 30 גיגה בייט, עדיף להשתמש במודל שמארח שירות חיצוני בריחוק.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/guanaco-65B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון המוגדר הוא other, ללא פירוט נוסף בטקסט של הכרטיס. במצב כזה אי אפשר לדעת אם מותר להשתמש בו באופן מסחרי במוצר שלכם, ומי שמתכנן שילוב באפליקציה עסקית חייב לבדוק את תנאי הרישיון של מודל המקור לפני השימוש.

הרישיון המלא בעמוד המודל ↗