GPT
G

GPT4-X-Alpaca-30B-4bit

קוד פתוח

MetaIXרישיון לא דווח2023-04-14

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

שילוב של מודל LLaMA בגודל 30B שעבר אימון LoRA עם דאטהסט של GPT4-Alpaca, וכווץ לגרסאות 4 ביט. מתאים למי שרוצה הרצה מקומית של מודל 30B על חומרה ביתית מתאימה.

  • 2,048טוקנים בהקשר
  • 95.1 GBמשקל הקבצים
  • 116הורדות בחודש
  • 163לייקים

מה זה

מדובר בגרסה מכווצת של המודל gpt4-alpaca-lora-30b של Chansung, המבוסס על ארכיטקטורת LLaMA עם 60 שכבות. המפרסם ארז כאן כמה גרסאות שונות של כימוס בפורמטי GPTQ למעבדים גרפיים ופורמטי GGML הרלוונטיים לשימוש על מעבדי מחשב רגילים, כדי לאפשר הרצה מקומית של משקלים גדולים בלי ציוד ענן יקר.

האימון עצמו כלל עשרה מחזורים עם אורך חיתוך של 512 טוקנים, על גבי מודולי המטרה של התשומת לב. מבחני הבלבול שהמפרסם צירף מראים שהגרסה עם groupsize 128 מגיעה לתוצאות מעט טובות יותר, כמו 4.28 בבדיקת Wikitext2 לעומת 4.48 בגרסת ה־act-order. המשמעות המעשית היא שגרסת ה־groupsize מייצרת טקסט מעט מדויק וקוהרנטי יותר, אך דורשת יותר זיכרון בהרצה.

מתאים ל

  • הרצה מקומית על כרטיס יחיד

    גרסת ה־act-order נכנסת ב־24GB VRAM ומאפשרת ניסוי במודל 30B ללא ענן.

  • ניסויי מעבד עם KoboldAI

    קבצי ה־GGML מאפשרים טעינה מקומית באמצעות מעבד וזיכרון מערכת בלבד.

  • מעקב אחר הוראות מורכבות

    האימון על נתוני Alpaca מבוססי GPT-4 נותן מענה טוב יותר לבקשות מובנות.

איפה זה נופל

חלון ההקשר עומד על 2,048 טוקנים בלבד, ואורך החיתוך באימון הוגבל ל־512 טוקנים, מה שאומר שהמודל יתקשה לעבד מסמכים ארוכים או לנהל שיחה ממושכת בלי לאבד את ההקשר. בנוסף, מדובר במודל שפורסם באפריל 2023 ומבוסס על גרסאות ישנות של GGML ו־GPTQ, כך שייתכנו בעיות תאימות מול ספריות מודרניות, וביצועיו בעברית לא נבדקו ולא הוגדרו כמטרה.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס מסך עם 16GB VRAM?

לא בגרסאות ה־GPTQ הקיימות כאן. גרסת ה־act-order דורשת לפחות 24GB של זיכרון וידאו כדי לפעול עם מלוא ההקשר, ולכן תצטרכו לעבור לגרסת GGML על המעבד או להשתמש בחומרה חזקה יותר.

באיזו גרסת קובץ כדאי לבחור מתוך המאגר?

אם יש לכם כרטיס מסך עם 24GB, גרסת act-order היא הבחירה היחידה שתיכנס בזיכרון. אם יש לכם יותר זיכרון, גרסת groupsize 128 תיתן איכות טקסט מעט טובה יותר, ולמעבדים בלבד עדיף לבחור באחד מקבצי ה־bin של GGML.

איך מריצים

כדי להריץ את גרסאות ה־GPTQ על גבי כרטיס מסך, תצטרכו לפחות 24GB של זיכרון וידאו. גרסת ה־act-order נכנסת בדיוק במגבלה הזו לכל אורך ההקשר, בעוד שגרסת ה־groupsize 128 תדרוש יותר מזה ותוביל לשגיאות מחסור בזיכרון על כרטיסים צרכניים פשוטים. ההרצה נעשית לרוב בממשקים כמו Oobabooga או KoboldAI, כשלגרסאות ה־GGML אפשר להסתפק במעבד וזיכרון RAM רגיל.

אם אתם לא צריכים פרטיות מלאה או שאין לכם כרטיס עם 24GB VRAM פנוי, עדיף פשוט לפנות ל־API חיצוני. המשקל הכולל של הקבצים במאגר מגיע ל־95.1 גיגה בייט, כך שהורדה והתקנה שלהם דורשות זמן ומשאבים פיזיים לא מבוטלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="MetaIX/GPT4-X-Alpaca-30B-4bit")
print(pipe("שלום"))

הרישיון

המפרסם לא דיווח על רישיון כלל. מעבר לכך, המודל מבוסס על LLaMA המקורית ועל נתוני אימון שנוצרו באמצעות GPT-4, שני גורמים שאינם מאפשרים שימוש מסחרי חופשי. בפועל, אי אפשר לשלב אותו במוצר מסחרי מבלי להסתכן בהפרת תנאי שימוש.

הרישיון המלא בעמוד המודל ↗