GPT
M

Mixtral-8x7B-Instruct-v0.1-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • gguf
  • mixtral
  • fr
  • it

גרסת GGUF מכווצת של מודל המומחים מבית Mistral AI, שמאפשרת להריץ יכולות שמנצחות את Llama 2 70B גם על מעבדים וחומרת צרכנים מקומית.

  • 225 GBמשקל הקבצים
  • 16,163הורדות בחודש
  • 656לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים דלילה (Sparse Mixture of Experts), שבה פועלות שמונה רשתות שונות של שבעה מיליארד פרמטרים תחת מעטפת אחת. המבנה הזה נותן ביצועים שעוקפים את Llama 2 70B ברוב המבחנים המקובלים, בלי הצורך לשלם את מחיר החישוב של מודל ענק בכל טוקן.

הקבצים כאן עברו המרה וכימוס לפורמט GGUF על ידי TheBloke, מה שפותח גישה ישירה להרצה דרך llama.cpp וכלים דומים בלי תלות בחוות שרתים עמוסות GPU. הוא תומך באנגלית, צרפתית, איטלקית, גרמנית וספרדית, ומיועד להבנת הוראות ושיחה.

בניגוד למודלים סטנדרטיים בגודל דומה, החלוקה הפנימית למומחים מאפשרת לו להגיב מהר יותר בהסקה, כל עוד יש לכם מספיק זיכרון להחזיק את המשקלים במלואם.

מתאים ל

  • הסקה מקומית על שרתי פיתוח

    מתאים לשרת פנימי עם שפע זיכרון RAM שצריך לעבד טקסטים באנגלית ללא תלות ברשת.

  • חלופה חופשית ל־Llama 2 70B

    נותן ביצועים עדיפים במבחנים מול מודלים של 70B, אך במבנה שמאפשר הסקה יעילה יותר.

  • עיבוד טקסט רב-לשוני באירופה

    מאומן רשמית על גרמנית, צרפתית, ספרדית ואיטלקית בנוסף לאנגלית, ללא צורך בהתאמות.

איפה זה נופל

Mistral מצהירים במפורש שהמודל הזה הוא הדגמה מהירה של יכולות הכוונון, ואין בו שום מנגנוני סינון או מיתון פנימיים. הוא פולט תוכן ללא הגנות מובנות, כך שאסור להכניס אותו למוצר מול משתמשים בלי שכבת ניטור וסינון חיצונית שתבדוק את הפלטים. בנוסף, חובה להיצמד לתבנית ההוראות המדויקת עם תגיות INST, אחרת התשובות מתדרדרות מיד באיכותן. תמיכה רשמית בעברית לא קיימת כאן, והשפות המוגדרות הן אירופאיות בלבד.

אותה משפחה

Mixtral יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

עברית לא מופיעה ברשימת השפות הנתמכות של המודל, שכוללת רק אנגלית, צרפתית, איטלקית, גרמנית וספרדית. הוא מסוגל לפלוט פה ושם מילים בעברית בזכות נתוני האימון הכלליים, אבל לא הייתי בונה עליו לשום משימה בעברית.

איזה קובץ בדיוק כדאי להוריד מהרשימה?

לרוב השימושים כדאי לקחת את mixtral-8x7b-instruct-v0.1.Q4_K_M.gguf. הוא מציע פשרה טובה של 4 ביט עם איכות שמורה ומשקל של 26.44 ג'יגה בייט, בלי לאבד דיוק כמו בגרסאות ה־2 וה־3 ביט.

האם חייבים כרטיס מסך כדי להפעיל אותו?

לא חובה, הקבצים מיועדים לעבודה גם על מעבד רגיל דרך llama.cpp, בתנאי שיש לכם לפחות 29 עד 35 ג'יגה בייט של זיכרון RAM פנוי במחשב. יחד עם זאת, פריקה חלקית של שכבות לכרטיס מסך תאיץ מאוד את קצב ייצור הטוקנים.

איך מריצים

כדי להריץ אותו צריך קודם כל לבחור קובץ אחד ולא להוריד את כל המאגר. הגרסה המאוזנת ביותר היא Q4_K_M ששוקלת 26.44 ג'יגה בייט ודורשת לפחות 28.94 ג'יגה בייט זיכרון עבודה כדי לרוץ בצורה חלקה על מעבד בלבד. אם תרצו איכות גבוהה יותר עם מינימום פגיעה, קובץ Q5_K_M ידרוש כמעט 35 ג'יגה בייט זיכרון, ואילו גרסאות ה־2 וה־3 ביט אמנם קטנות אבל מאבדות איכות משמעותית.

אפשר לטעון את הקבצים ישירות בתוכנות כמו LM Studio, KoboldCpp מגרסה 1.52, או דרך llama-cpp-python בקוד. אם אין לכם לפחות 32 ג'יגה בייט של זיכרון RAM או כרטיס מסך מקצועי עם מספיק VRAM לפריקת שכבות, הריצה המקומית תזחל ועדיף לפנות ל־API חיצוני.

ollama run hf.co/TheBloke/Mixtral-8x7B-Instruct-v0.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי והפצה של המשקלים במוצרים שלכם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗