GPT
V

Vicuna-13B-1.1-GPTQ

קוד פתוח

TheBlokeother2023-04-12

  • transformers
  • llama
  • text-generation
  • conversational

גרסת 4-ביט מכווצת של צ'אטבוט 13B המבוסס על Llama, שנועדה לחסוך בזיכרון ולהריץ שיחות מקומית על כרטיס מסך ביתי בלי לשלם על שירותי ענן יקרים.

  • 2,048טוקנים בהקשר
  • 6.8 GBמשקל הקבצים
  • 441הורדות בחודש
  • 206לייקים

מה זה

הפרויקט הזה מציג כיווץ GPTQ לגרסה 1.1 של ויקוניה, מודל שיחה שנוצר מכוונון עדין של Llama על גבי 70 אלף שיחות משתמשים שנאספו מ־ShareGPT על ידי חוקרים מברקלי, סטנפורד ומוסדות נוספים. גרסה 1.1 מתקנת את חישוב הפסד האימון ומחליפה את תו ההפרדה לתו סיום רגיל, מה שמסייע למודל לדעת מתי לעצור את התשובה בצורה נקייה.

במקום להחזיק משקלים מלאים שדורשים חומרה מקצועית, הקבצים כאן מכווצים ל־4 ביט עם groupsize 128 ושוקלים 6.8 ג'יגה בייט בסך הכל. הערכת האיכות הראשונית של המפתחים התבססה על 80 שאלות שנשפטו בידי GPT-4, כך שמדובר בכלי שמכוון בעיקר לחוויית צ'אט ושיחה שוטפת.

מתאים ל

  • עוזר שיחה מקומי

    אימון על עשרות אלפי שיחות ShareGPT הופך אותו למתאים במיוחד למענה על שאלות כלליות בסביבה פרטית ללא רשת.

  • מחקר וניסויי שפה

    הכרטיס מגדיר את המודל ככלי מחקר עבור אנשי עיבוד שפה טבעית שרוצים לבחון התנהגות מודלי שיחה.

  • הרצה חסכונית בחומרה ביתית

    משקל של 6.8 ג'יגה בייט מאפשר בדיקות מקומיות על כרטיס מסך בודד בעל זיכרון צנוע יחסית.

איפה זה נופל

המודל מוגבל לחלון הקשר קצר של 2,048 טוקנים בלבד, מה שמקשה מאוד על ניתוח מסמכים ארוכים או ניהול שיחות ממושכות בלי לאבד את ההתחלה. שימוש בגרסת safetensors עלול לפלוט ג'יבריש מוחלט אם סביבת ההרצה אינה מעודכנת בקוד העדכני של GPTQ-for-LLaMa. בנוסף, האימון התבסס על שאלות שנשפטו בבדיקה מצומצמת של 80 מקרים בלבד, והוא מיועד בעיקר למחקר ולא נבדק למשימות מורכבות של לוגיקה או יצירת קוד מהימן.

שאלות
נפוצות

למה המודל מחזיר טקסט מקולקל ולא ברור?

זה קורה כשמנסים להריץ את קובץ ה־safetensors עם גרסה ישנה של ספריית GPTQ-for-LLaMa. כדי לפתור את זה יש לעדכן את הספרייה בממשק או לעבור לקובץ ה־pt שמיועד לתאימות לאחור ללא act-order.

האם אפשר להשתמש במודל הזה בתוך אפליקציה מסחרית?

הרישיון המדווח מוגדר כאחר, ומטרות השימוש הרשמיות של הפרויקט מגבילות אותו למחקר ולתחביב בלבד. לאור התבססותו על נתוני Llama ו־ShareGPT, הטמעה במוצר מסחרי חושפת אתכם לסיכונים משפטיים.

איך מריצים

כדי להריץ אותו מקומית צריך כרטיס מסך עם לפחות 8 עד 10 ג'יגה זיכרון וידאו, מה שמתאים לכרטיסים ביתיים נפוצים. ההרצה נעשית דרך כלי כמו text-generation-webui באמצעות ספריית GPTQ-for-LLaMa, עם הגדרות של 4 ביט ו־groupsize של 128.

המאגר מציע שני קבצים שונים. קובץ safetensors נבנה עם act-order לאיכות גבוהה יותר אך דורש תמיכה מעודכנת של הספרייה, וקובץ pt ישן יותר שמתאים למי שלא רוצה להסתבך עם קומפילציה על ווינדוס. אם אתם לא מחזיקים כרטיס מסך ייעודי, עדיף להשתמש במחברת Google Colab החינמית שצורפה או לפנות לשירותי ענן חיצוניים.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Vicuna-13B-1.1-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון המוגדר במאגר הוא other, למרות שבכרטיס המקורי מופיע אזכור לרישיון Apache 2.0. בפועל המודל מבוסס על משקלי Llama המקוריים ואומן על דאטה של ShareGPT, ויועדיו המוגדרים הם מחקר בלבד עבור חוקרים וחובבים. שילוב שלו במוצר מסחרי בעייתי מאוד מבחינה משפטית ולא מומלץ.

הרישיון המלא בעמוד המודל ↗