GPT
M

Mixtral-8x7B-Instruct-v0.1-GPTQ

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • conversational

גרסה מכווצת בשיטת GPTQ לאחד ממודלי הקוד הפתוח החזקים של Mistral. היא מאפשרת להריץ מודל של 47 מיליארד פרמטרים על כרטיסי מסך בודדים עם זיכרון בינוני בלי להקריב יותר מדי ביצועים.

  • 47Bפרמטרים
  • 32,768טוקנים בהקשר
  • 22.2 GBמשקל הקבצים
  • 497הורדות בחודש

מה זה

מדובר בהמרה של Mixtral 8x7B למשקולות בפורמט GPTQ, שנועדה לחסוך מקום וזיכרון בריצה על מעבדים גרפיים. המודל המקורי בנוי בארכיטקטורת Sparse Mixture of Experts, כלומר מתוך 47 מיליארד הפרמטרים שלו רק חלק מופעלים בפועל בכל טוקן, מה שנותן מהירות יחסית לגודל. היוצרים טוענים שהגרסה המקורית עוקפת את Llama 2 70B ברוב המבחנים, וגרסת ההוראות הזו עברה כיוונון מיוחד למענה ישיר למשתמש.

היתרון הגדול של החבילה הזו הוא הגמישות. TheBloke הוציא כאן פיצול לכמה ענפים שונים, מגרסאות של 3 ביט ועד 8 ביט, עם או בלי גדלי קבוצות שונים. המודל שומר על חלון הקשר נדיב של 32,768 טוקנים, אם כי כיול הקוונטיזציה בוצע על אורך רצף של 8,192 טוקנים.

מתאים ל

  • שרת צ׳אט לחברות

    מאפשר לעבד פניות משתמשים בדיוק גבוה על גבי שרת מקומי עם כרטיס 24GB בודד ללא תלות בענן חיצוני.

  • ניתוח מסמכים רב לשוניים

    מנצל את חלון ההקשר של 32,768 טוקנים ואת התמיכה המובנית באנגלית ושפות אירופאיות לעיבוד טקסט ארוך.

  • אוטומציית משימות פיתוח

    מבצע הוראות מורכבות וכתיבת סקריפטים בסביבה פרטית, על בסיס היכולות שהציג המודל מול מודלים של 70B.

איפה זה נופל

בכרטיס המודל מצוין במפורש ש־ExLlama אינו נתמך עבור הקבצים האלה, וכך גם פריסה דרך TGI, מה שמגביל את אפשרויות ההגשה שלכם בעיקר ל־AutoGPTQ או Transformers ישירות. הריצה מחייבת הקפדה עיוורת על תבנית ההוראות עם התגיות הייעודיות של Mistral, אחרת איכות הפלט מתרסקת מיד.

מעבר לזה, רשימת השפות הרשמית כוללת אנגלית, צרפתית, איטלקית, גרמנית וספרדית בלבד. עברית לא נכללת בשפות המקוריות של המודל, ולכן כל שימוש בטקסט מקומי ידרוש בדיקה יסודית של תקינות התחביר ואיכות התוצאה.

אותה משפחה

Mixtral יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב מק עם מעבד אפל סיליקון?

לא. קובצי GPTQ מיועדים למעבדים גרפיים של אנבידיה ו־AMD בסביבות לינוקס ווינדוס. בשביל מחשבי מק תצטרכו להוריד גרסאות GGUF מתאימות.

באיזה ענף כדאי לבחור אם יש לי כרטיס מסך ביתי חזק של 24GB?

ענף ברירת המחדל של 4 ביט תופס 23.81 גיגהבייט ולכן יישאר לכם מעט מאוד זיכרון לחלון ההקשר. אם אתם נתקלים בשגיאות מחסור בזיכרון, כדאי לרדת ישירות לגרסת 3 ביט שתופסת כ־18 גיגהבייט.

איך מריצים

כדי להריץ את גרסת ברירת המחדל של 4 ביט תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון וידאו, כמו RTX 3090 או RTX 4090, שכן המשקולות לבדן תופסות כמעט 24 גיגהבייט לפני חישוב הזיכרון לחלון ההקשר. גרסאות ה־3 ביט יורדות לאזור ה־18 גיגהבייט ומשאירות מעט יותר מרווח נשימה, בעוד גרסאות ה־8 ביט דורשות מעל 47 גיגהבייט ומחייבות שני כרטיסים או חומרה ייעודית לתחנות עבודה.

הריצה דורשת סביבת לינוקס או ווינדוס עם תמיכה ב־CUDA, יחד עם Transformers בגרסה 4.36.0 לפחות וספריית AutoGPTQ. משתמשי מק לא יכולים להריץ את הקבצים האלה וצריכים לחפש גרסאות GGUF. אם אין לכם גישה למאיץ גרפי מתאים עם מספיק זיכרון פנוי, עדיף בהרבה לפנות לספק ענן או ל־API מנוהל שמחזיק את המודל המקורי.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Mixtral-8x7B-Instruct-v0.1-GPTQ")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או מסחרית בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והעתק הרישיון בכל הפצה של התוכנה או המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗