GPT
M

Mixtral-8x7B-v0.1-GPTQ

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • fr

גרסת קוונטיזציה של מודל המומחים של Mistral AI, שמכווצת 47 מיליארד פרמטרים לנפח שניתן להריץ על חומרה מקומית. הוא מציע ביצועים שעוקפים את Llama 2 70B במבחנים שונים אבל דורש פחות משאבים.

  • 47Bפרמטרים
  • 32,768טוקנים בהקשר
  • 22.2 GBמשקל הקבצים
  • 13,430הורדות בחודש

מה זה

מדובר בגרסת GPTQ למודל Mixtral 8x7B של Mistral AI, בארכיטקטורת Sparse Mixture of Experts. אף על פי שיש לו מעל 46 מיליארד פרמטרים, המבנה שלו מפעיל רק חלק קטן מהם בכל טוקן, כך שמקבלים איכות גבוהה במהירות חישוב טובה בהרבה ממודלים מונוליתיים בגודל דומה.

לפי המדידות של יוצרי המודל המקורי, הוא גובר על Llama 2 70B ברוב המבחנים שנבדקו. TheBloke יצר כאן המרות GPTQ בנפחי 3, 4 ו־8 ביט על בסיס סט הנתונים VMware Open Instruct, מה שמאפשר לדחוס את המודל לכרטיסי מסך ביתיים או שרתים קטנים יותר בלי לאבד את רוב הדיוק של המקור.

מתאים ל

  • השלמת טקסט באנגלית ובאירופית

    מאומן רשמית על אנגלית, צרפתית, איטלקית, גרמנית וספרדית עם יכולות גנרציה ברמה של מודל ענק.

  • בסיס לאימון מודל ייעודי

    משמש כמודל בסיס חזק ופתוח לביצוע fine-tuning למשימות מוגדרות מראש בארגון.

  • שרת הסקות פרטי מקומי

    מאפשר עיבוד נתונים פנימיים ומאובטחים על גבי כרטיס 24GB בודד ללא תלות ברשת חיצונית.

איפה זה נופל

הבעיה המרכזית היא שזהו מודל בסיס לא מכויל (base model), ללא אימון הנחיות וללא שום מנגנוני בטיחות או סינון תוכן מובנים. הוא פשוט משלים טקסט ולא יענה בצורה ממושמעת לפקודות ישירות בלי כיוונון עדין נוסף מצדכם.

בנוסף, הכרטיס מציין שהכיול לקוונטיזציה נעשה על רצפים באורך 4,096 טוקנים בלבד. אף על פי שהמודל תומך בחלון של עד 32,768 טוקנים, ברצפים ארוכים מאוד ייתכנו ירידה בדיוק ואיבוד עקביות, וצריך לבדוק את זה ידנית לפני שסומכים עליו עם טקסטים ארוכים.

אותה משפחה

Mixtral יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל הזה על מקבוק עם מעבד Apple Silicon?

לא. גרסת GPTQ מיועדת ללינוקס ולחלונות בלבד עם תמיכה במעבדי אנבידיה או AMD. עבור משתמשי מק מומלץ לחפש את גרסאות ה־GGUF של אותו מודל.

איזו גרסה מומלצת להורדה מהענפים השונים?

הענף הראשי (main) מכיל גרסת 4 ביט ששוקלת 23.81GB ומספקת את האיזון הטוב ביותר בין שמירה על דיוק לבין שימוש מופחת בזיכרון, שנכנס בכרטיס 24GB.

המודל מגיע מוכן לשיחה בסגנון צ'אט?

לא. מדובר במודל בסיס שנועד להשלמת טקסט ואין לו תבנית צ'אט או מנגנוני בטיחות. כדי לנהל איתו שיחות תצטרכו להשתמש בגרסת Instruct או לעשות לו כיוונון ייעודי.

איך מריצים

כדי להריץ אותו בגרסת 4 ביט הראשית תצטרכו לפחות 24GB של זיכרון וידאו, מה שאומר כרטיס כמו RTX 3090, RTX 4090 או כרטיסי שרת מקבילים. שימו לב שגרסאות ה־8 ביט כבר שוקלות סביב 47GB ודורשות מערך מרובה כרטיסים. המודל נתמך בלינוקס עם כרטיסי אנבידיה או AMD, ובחלונות עם אנבידיה בלבד, אך אינו עובד על macOS בגרסה זו ואינו תואם כרגע ל־ExLlama או ל־TGI.

ההתקנה דורשת ספריות ספציפיות: גרסת Transformers 4.36.0 לפחות, יחד עם AutoGPTQ 0.6 שנבנה מקוד המקור או Transformers מגרסת הפיתוח של גיטהאב. אם אתם צריכים שירות יציב בייצור ולא רוצים להסתבך עם קומפילציה ידנית וניהול זיכרון של מודל שוקל 23GB, כנראה שעדיף לשלם על קריאות API מוכנות מספק צד שלישי.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Mixtral-8x7B-v0.1-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו ליישומים מסחריים, לשנות את הקבצים, להטמיע אותם במוצר שלכם ולהפיץ הלאה בלי תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗