GPT
W

wizard-mega-13B-GPTQ

קוד פתוח

TheBlokeother2023-05-15

  • transformers
  • safetensors
  • llama
  • text-generation
  • en

גרסת GPTQ מכווצת של מודל שיחה בן 13 מיליארד פרמטרים. היא נועדה למי שרוצה להריץ מודל טקסט מקומי על כרטיס מסך בודד בלי לשלם על API חיצוני.

  • 13Bפרמטרים
  • 2,048טוקנים בהקשר
  • 6.9 GBמשקל הקבצים
  • 83הורדות בחודש

מה זה

מדובר בהמרה ברוחב 4 ביט של מודל שפותח במקור על ידי Open Access AI Collective. הבסיס הוא Llama 13B שעבר אימון על שילוב של שלושה מאגרי שיחות והוראות: ShareGPT, WizardLM ו־Wizard-Vicuna. המטרה המרכזית בבנייה שלו הייתה לנקות מראש תשובות מתחמקות שכוללות ניסוחים כמו 'כמודל שפה אני לא יכול', כך שהוא מנסה לענות ישירות על שאלות וקוד בלי להתחכם או לסרב.

האימון נעצר אחרי שני מחזורים בלבד בגלל עלייה בשגיאת הבדיקה במחזור השלישי. התוצאה היא כלי שמסוגל לכתוב קוד פייתון פשוט, לנהל שיחה קצרה ולהמשיך בדיחות, אבל ללא עידון מעמיק יותר. הדף מציין במפורש שהמודל הזה כבר עודכן והוחלף בגרסה חדשה יותר בשם Manticore 13B, כך שהוא מייצג שלב מוקדם למדי בסדרת הפיתוח הזו.

מתאים ל

  • הרצת צ'אט מקומית

    מאפשר שיחה ומענה ישיר על שאלות באנגלית על חומרת GPU צנועה, ללא תלות ברשת חיצונית.

  • יצירת קוד פייתון בסיסי

    מספק דוגמאות לפונקציות קצרות ואלגוריתמים מוכרים כמו סדרת פיבונאצ'י לפי תבנית Vicuna.

  • בדיקות תאימות ExLlama

    מתאים לבדיקת ביצועי מהירות של מנועי הסקה ב־4 ביט על כרטיסי מסך מוגבלי זיכרון.

איפה זה נופל

המודל מוגבל לחלון הקשר קצרצר של 2,048 טוקנים, מה שפוסל אותו מניתוח מסמכים ארוכים או שיחות מתמשכות. בנוסף, הוא לא עבר התאמה להעדפות אנושיות בשיטות כמו RLHF ואין בו מנגנוני סינון פנימיים, מה שאומר שהוא עלול לייצר פלטים בעייתיים או שגויים כשמבקשים ממנו. הוא אומן באנגלית בלבד ולכן לא יתפקד כראוי בעברית, ואינו כולל הגנות מובנות נגד הטיות.

שאלות
נפוצות

האם כדאי להתקין אותו כיום עבור מוצר חדש?

לא. המפתחים המקוריים עצמם ציינו שהוא הוחלף במודל בשם Manticore שתיקן בעיות רבות, ולכן אין סיבה טכנית להתחיל איתו פרויקט חדש.

האם המודל יפעל טוב בעברית?

האימון נעשה כולו באנגלית על בסיס נתוני Llama הראשונה. הוא לא יבין פניות מורכבות בעברית ואינו מיועד למשימות בשפה זו.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.45 גיגה בייט, מה שמאפשר לטעון אותו בקלות לתוך כרטיס מסך ביתי עם 8 או 12 גיגה בייט של זיכרון גרפי. ענף ה־main מגיע בתצורת 4 ביט עם גודל קבוצה של 128 וללא סדר הפעלה, ונבדק לעבודה מול ספריות AutoGPTQ, ממשק text-generation-webui, מנוע ExLlama ושרת TGI.

אם אתם צריכים רק מענה לפקודות פשוטות על GPU קיים, ההרצה המקומית הגיונית. אם אתם צריכים יציבות או הקשר ארוך, תשלום לפי טוקן לשירות ענן מודרני ייתן תוצאות עדיפות בהרבה בלי להתעסק עם תצורות דרייברים.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/wizard-mega-13B-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ללא פירוט תנאים משפטיים מדויקים בדף המודל. היות שהוא מבוסס על Llama הראשונה ונתוני שיחות ממקורות שונים, אין אישור מפורש לשימוש מסחרי חופשי, ולא הייתי משלב אותו במוצר מסחרי סגור בלי לבדוק לעומק את תנאי המקור של משקלי הבסיס.

הרישיון המלא בעמוד המודל ↗