GPT
G

gpt4-x-alpaca-13b-native-4bit-128g

קוד פתוח

anon8231489123רישיון לא דווח2023-04-01

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסת קוונטיזציה מוקדמת של מודל ההוראות gpt4-x-alpaca שמיועדת למעבדים גרפיים צנועים. מי שיוריד אותה מחפש בעיקר להריץ מודל 13B מקומי שכוונן על דאטה של GPTeacher.

  • 24.4 GBמשקל הקבצים
  • 163הורדות בחודש
  • 727לייקים
  • 40שכבות

מה זה

מדובר בהמרה של המודל chavinlo/gpt4-x-alpaca לפורמט 4 ביט עם גודל קבוצה של 128 באמצעות GPTQ. בבסיסו הוא מבוסס על ארכיטקטורת LLaMA עם 40 שכבות, ואומן על בסיס הנתונים GPTeacher של teknium1 שכולל דאטה של מילוי הוראות שנוצר בסיוע מודלים חזקים. המטרה של המפרסם היתה לקחת מודל כבד יחסית של 13 מיליארד פרמטרים ולכווץ אותו כדי שיתאים לכרטיסי מסך ביתיים בלי לדרוש משאבי עתק.

המשקל המקורי מפוצל כאן לקבצים שתופסים 24.4 גיגה בייט במאגר, אבל הקוונטיזציה נועדה לחתוך דרמטית את תפוסת הזיכרון בזמן ריצה. החבילה הזו מייצגת את הניסויים הראשונים של קהילת הקוד הפתוח באפריל 2023 להביא ביצועים של מודלים מאומני הוראות לסביבות עבודה פרטיות, לפני שהפורמטים והספריות התייצבו על תקנים אחידים ונוחים יותר.

מתאים ל

  • הרצה מקומית על כרטיס בודד

    מתאים למי שמחזיק מעבד גרפי ביתי ורוצה מודל 13B מכווץ בלי להוציא כסף על שרתים יקרים.

  • מילוי הוראות באנגלית

    האימון על GPTeacher מכוון למענה ישיר למשימות טקסט קצרות והנחיות מוגדרות.

  • ניסויי קוונטיזציה מוקדמים

    רלוונטי לבדיקת התנהגות של GPTQ בגרסאות ישנות מול קוד מקור תואם מלפני שנה ויותר.

איפה זה נופל

הבעיה המרכזית פה היא תאימות ותחזוקה ישנה. המודל עלה באפריל 2023 ומבוסס על קומיט ספציפי מאוד של GPTQ-for-LLaMa מלפני שינויים גדולים באקוסיסטם, ולכן הסיכוי שהוא יעבוד חלק מהקופסה בספריות מודרניות נמוך. המפרסם עצמו הודה שהגרסה הראשונה לא עבדה עם Oobabooga בגלל שימוש בענף טרייטון. בנוסף, מדובר במודל שכוונן על נתוני הוראות מלאכותיים בלי בקרת איכות מוכחת, כך שאין שום ערבות לדיוק התשובות או להתאמה למשימות מורכבות בלי הזיות, ולא הייתי מכניס אותו למערכת מבצעית בלי בדיקה יסודית של כל פלט.

שאלות
נפוצות

למה המודל לא עולה לי בממשק Oobabooga?

גרסת הטרייטון המקורית לא נתמכת שם בגלל מבנה הקוד של אותה תקופה. המפרסם ממליץ להוריד ולהריץ את הקובץ שנוצר בגרסת הקודה ולא בטרייטון.

האם המודל מתאים לשימוש בעברית?

אין שום תיעוד על דאטה בעברית באימון של GPTeacher או של מודל הבסיס. היכולת שלו להבין או לכתוב עברית תקינה שואפת לאפס.

מה צריך להתקין כדי להפעיל אותו?

צריך סביבת פייתון עם הקוד של GPTQ-for-LLaMa בקומיט הספציפי שצוין, יחד עם תמיכת Cuda מתאימה להרצת הסקריפט llama.py.

איך מריצים

כדי להריץ אותו בפועל צריך כרטיס מסך של אנבידיה עם תמיכה בגרסת Cuda שהמפרסם ציין, באמצעות הקוד של GPTQ-for-LLaMa. המפרסם מציין פקודת ריצה ישירה של llama.py עם הגדרות של 4 ביט, true sequential וגודל בלוק של 128. יש שני מימושים שנוצרו, אחד בענף הטרייטון ואחד בענף הקודה, וההמלצה הרשמית בעמוד היא להשתמש בגרסת הקודה כי גרסת הטרייטון שברה תאימות עם ממשקים פופולריים כמו Oobabooga.

אם אין לכם כרטיס עם מספיק זיכרון וידאו, יש בעמוד אזכור לקובץ ggml שמאפשר הרצה על מעבד רגיל. עם זאת, אם אתם מחפשים יציבות או שאין לכם כוח להסתבך עם ענפי גיטהאב ישנים והתקנות ידניות של סביבות פייתון מורכבות, עדיף להשתמש במודל מודרני יותר דרך ממשק קיים או לשלם על קריאות שרת חיצוניות.

from transformers import pipeline

pipe = pipeline("text-generation", model="anon8231489123/gpt4-x-alpaca-13b-native-4bit-128g")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המאגר. המשמעות בפועל היא שאין לכם שום אישור משפטי להשתמש במודל הזה, להפיץ אותו או לשלב אותו בתוך מוצר מסחרי. מעבר לזה, הוא מבוסס על LLaMA הראשונה ועל נתוני GPTeacher שחלקם נוצרו ממודלים סגורים, כך שסביר להניח שמבחינת זכויות יוצרים השימוש מוגבל למחקר אישי בלבד.

הרישיון המלא בעמוד המודל ↗