GPT
N

Nous-Hermes-13B-GPTQ

קוד פתוח

TheBlokeother2023-06-03

  • transformers
  • safetensors
  • llama
  • text-generation
  • self-instruct

גרסת 4 ביט של מודל פופולרי, שמכווצת 13 מיליארד פרמטרים לנפח של פחות משבעה גיגה בייט. היא מיועדת למי שרוצה להריץ מודל הוראות סביר על כרטיס מסך ביתי בודד.

  • 13Bפרמטרים
  • 2,048טוקנים בהקשר
  • 6.9 GBמשקל הקבצים
  • 145הורדות בחודש

מה זה

מדובר בכימות GPTQ של המודל Nous-Hermes-13B, המבוסס על ארכיטקטורת LLaMA המקורית. המודל עבר כוונון עדין על יותר מ־300,000 הוראות, כאשר חלק ניכר מהדאטה מבוסס על פלטים סינתטיים של מודלים חזקים יותר כמו GPT-4. החבילה הזו כוללת סטים מגוונים של קוד, מדעים, שיחה והוראות ללא הצנזורה המובנית שקיימת במודלים מסחריים סגורים.

היוצרים טוענים לביצועים שמזכירים מודלים קנייניים מהשורה הראשונה, אבל בכרטיס המודל אין מדדי בנצ'מרק מספריים לאימות הטענה, אלא הבטחה לבדיקות עתידיות. היתרון המרכזי כאן הוא היכולת לקבל מענה מפורט יחסית למשימות טקסט וקוד, בלי לשלוח מידע החוצה ובלי לחכות לתורים בענן, כל עוד מזינים את הפרומפט במבנה המדויק של Alpaca שהמודל מכיר מהאימון.

מתאים ל

  • בוט שיחה מקומי

    מאפשר הרצת עוזר אישי בתוך רשת מקומית ללא הוצאת נתונים, כל עוד השיחה קצרה ומתנהלת באנגלית.

  • סיוע בכתיבת קוד פשוט

    מתאים להשלמת פונקציות קצרות וסקריפטים על בסיס דאטהסטים ייעודיים של קוד שנכללו באימון.

  • יצירת טקסט חופשי

    מייצר תשובות ארוכות ומפורטות בלי מנגנוני סינון נוקשים שקיימים במערכות סגורות.

איפה זה נופל

הבעיה הבולטת ביותר היא חלון ההקשר, שמוגבל ל־2,048 טוקנים בלבד. במגבלה כזו קשה מאוד לעבד מסמכים ארוכים, לבצע שיחות ממושכות או להזין קבצי קוד מורכבים. בנוסף, המודל אומן בעיקר על אנגלית, ולכן ביצועיו בעברית צפויים להיות ירודים מאוד. אין בכרטיס נתוני מדידה רשמיים, וההסתמכות על דאטה סינתטי עלולה להוביל לשגיאות עובדתיות שמוצגות בביטחון מטעה.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל מוגדר ומאומן עבור השפה האנגלית בלבד. הוא לא נועד לעבודה בעברית, וסביר להניח שייצר טקסט משובש או יתקשה להבין שאלות מקומיות.

האם אני חייב כרטיס מסך כדי להריץ את הגרסה הזו?

כן, קובצי GPTQ בנויים במיוחד להאצה על גבי מעבדים גרפיים ותלויים בספריות תואמות. אם אתם רוצים להריץ על מעבד רגיל, עליכם לחפש את גרסאות ה־GGML של המודל.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.9 גיגה בייט, מה שאומר שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 10 או 12 גיגה בייט של זיכרון ייעודי. הקובץ המרכזי מוגדר עם גודל קבוצה של 128 וללא סדר הפעלה מיוחד, כך שהוא נתמך ישירות בספריית AutoGPTQ ומתאים לטעינה פשוטה בממשקים גרפיים כמו text-generation-webui.

אם יש לכם כרטיס מסך עם פחות מ־8 גיגה בייט זיכרון, עדיף לפנות לגרסאות מבוססות מעבד או פשוט לשלוח בקשות דרך שירות ענן חיצוני. הרצה מקומית של מודל כזה דורשת הגדרה נכונה של מנהלי ההתקנים של אנבידיה וסביבת פייתון ייעודית, ואינה משתלמת אם אתם צריכים רק כמה תשובות בודדות ביום.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Nous-Hermes-13B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון המוגדר הוא other, ללא פירוט של תנאי שימוש ברורים. מאחר שהמודל מבוסס על הדור הראשון של LLaMA ואומן על פלטים סינתטיים ממודלים מסחריים, שימוש מסחרי בו כרוך בסיכון משפטי ואינו מומלץ למוצרים מסחריים.

הרישיון המלא בעמוד המודל ↗