GPT
M

Mixtral-8x7B-Instruct-v0.1-AWQ

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • conversational

גרסת קוונטיזציה של מודל המומחים מבית Mistral שמכווצת אותו לריצה על כרטיסי מסך בודדים. מקבלים יכולות של מודל ענק עם זמני תגובה מהירים בהרבה מגרסאות לא מכווצות.

  • 47Bפרמטרים
  • 32,768טוקנים בהקשר
  • 23.0 GBמשקל הקבצים
  • 3,297הורדות בחודש

מה זה

מדובר בגרסת AWQ בארבעה ביט למודל Mixtral 8x7B במבנה של Mixture of Experts, שכולל בסך הכול כמעט 47 מיליארד פרמטרים. בפועל, המבנה הזה מפעיל רק חלק קטן מהרשת בכל טוקן, כך שמקבלים ביצועים שהיצרן מדווח שעוקפים את Llama 2 70B ברוב המבחנים, אבל עם מהירות היסק שמזכירה מודלים קטנים בהרבה.

הקוונטיזציה בוצעה באמצעות קבוצות של 128 על גבי דאטהסט VMware Open Instruct באורך רצף של 8192 טוקנים. שיטת AWQ נותנת יתרון ביצועים ברור על פני GPTQ בספריות כמו Transformers ו־vLLM, בלי לאבד מאיכות התשובות, מה שמתאים בעיקר למי שרוצה להרים שרת היסק עצמאי עם נפח תעבורה אמיתי.

מתאים ל

  • שרת היסק פנימי בארגון

    מאפשר הרצה מקומית ומהירה דרך vLLM על גבי כרטיס מסך בודד של 24 גיגה בלי להוציא מידע רגיש החוצה.

  • עיבוד מסמכים אירופיים

    מתאים לניתוח טקסטים ארוכים בחמש השפות הנתמכות רשמית, ביניהן אנגלית, צרפתית וגרמנית.

  • בוט שיחה ומענה להוראות

    המבנה של Instruct בשילוב ארכיטקטורת מומחים מייצר תשובות ממוקדות ומהירות לפקודות מוגדרות היטב.

איפה זה נופל

היצרן מצהיר מפורשות שלמודל אין מנגנוני סינון ובקרה, כך שהוא עלול לייצר תוכן פוגעני או רעיל בלי אזהרה, מה שמחייב שכבת בדיקה עצמאית לפני חשיפה למשתמשי קצה. מעבר לזה, תבנית הפרומפט קשיחה ודורשת עטיפה מדויקת בתגיות INST, אחרת הפלט מתדרדר מהר מאוד. המודל מאומן רשמית רק על אנגלית, צרפתית, גרמנית, ספרדית ואיטלקית, כך שעברית אינה ברשימת השפות הנתמכות והדיוק בה מוטל בספק.

אותה משפחה

Mixtral יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה רשמית?

לא. רשימת השפות הרשמית כוללת רק אנגלית, צרפתית, איטלקית, גרמנית וספרדית. הוא עשוי להבין מילים בעברית בגלל הדאטה הכללי, אבל התחביר והתשובות לא יהיו אמינים לשימוש עסקי.

אפשר להריץ את הקבצים האלה על מחשב מק עם מעבד אפל סיליקון?

לא ישירות. פורמט AWQ מיועד לכרטיסי מסך של Nvidia על מערכות לינוקס או ווינדוס בלבד. אם יש לכם מחשב Mac, עדיף להוריד את גרסאות ה־GGUF של אותו מודל.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך של Nvidia בלבד, על לינוקס או ווינדוס. משקל הקבצים הוא 23 גיגה־בייט, ולכן דרוש כרטיס עם לפחות 24 גיגה זיכרון גרפי כמו RTX 3090 או RTX 4090 רק כדי לטעון אותו, או עדיף כרטיס מקצועי דוגמת A10G או A100 אם רוצים חלון הקשר מלא של 32,768 טוקנים. משתמשי Mac יצטרכו לחפש גרסת GGUF כי AWQ לא נתמך אצלם.

בסביבת ייצור הדרך הנוחה היא להשתמש ב־vLLM החל מגרסה 0.2.2 עם הדגל של awq, או דרך Hugging Face TGI מגרסה 1.1.0 ומעלה. אם אתם צריכים רק שאילתות בודדות ביום ולא מחזיקים שרת GPU שפועל רצוף בענן, כנראה יהיה לכם זול יותר לשלם לספק API חיצוני לפי טוקנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Mixtral-8x7B-Instruct-v0.1-AWQ")
print(pipe("שלום"))

הרישיון

המודל מופץ ברישיון Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהריץ אותו בכל תשתית שתבחרו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗