GPT
M

Mixtral-8x22B-v0.1-GGUF

קוד פתוח

MaziyarPanahiapache-2.02024-04-10

  • transformers
  • gguf
  • mixtral
  • text-generation
  • quantized

גרסת GGUF מכווצת של ענק הקוד הפתוח מבית Mistral. מקבלים כאן יכולות חזקות בזכות ארכיטקטורת מומחים, בלי לשלם על הרצת כל הפרמטרים בכל טוקן.

  • 65,536טוקנים בהקשר
  • 1.2 TBמשקל הקבצים
  • 160,163הורדות בחודש
  • 78לייקים

מה זה

מדובר בארכיטקטורת תערובת מומחים עם מאה ארבעים ואחד מיליארד פרמטרים בסך הכול, אבל רק שלושים וחמישה מיליארד מהם פעילים בפועל בכל רגע נתון. המודל מיועד ליצירת טקסט ויודע לעבוד עם חלון הקשר של שישים וחמישה אלף טוקנים, מה שמאפשר להזין לו מסמכים שלמים בלי לחתוך אותם לחתיכות קטנות.

המאגר הזה מחזיק גרסאות שעברו כימות לפורמט GGUF, כך שניתן לטעון אותו בעזרת llama.cpp בחלקים מחולקים. הוא מגיע כמודל בסיס נקי בלי כוונון לשיחות, כשהוא מאומן מראש על חמש שפות עיקריות, אנגלית, צרפתית, ספרדית, איטלקית וגרמנית.

מתאים ל

  • אימון מודלים מותאמים

    מודל בסיס מעולה לכוונון עדין על דאטה פנימי של ארגון בזכות חלון הקשר ענק.

  • השלמת טקסטים ארוכים

    מתאים להמשך יצירת תוכן בחמש השפות הנתמכות כשצריך קלט רחב של אלפי מילים.

  • הרצה מקומית על שרתי ענן

    גרסת ה־int4 מאפשרת להרים מערכת עצמאית ומאובטחת על כרטיסי זיכרון של 80GB.

איפה זה נופל

זהו מודל בסיס בלבד. הכרטיס מציין במפורש שבגלל שמדובר בגרסת בסיס הוא ממשיך לייצר טקסט ברצף ולא יודע מתי לעצור כמו בוט שיחה רגיל. בנוסף, הוא לא תומך בעברית לפי רשימת השפות המוגדרת, כך שאי אפשר לבנות עליו לפרויקטים מקומיים בלי כוונון ייעודי נוסף.

שאלות
נפוצות

האם המודל מוכן לעבודה כצ'אטבוט?

לא. מדובר במודל בסיס שנועד להשלמת טקסט ולא עבר אימון ייעודי להוראות או לשיחה. אם תשאלו אותו שאלה הוא פשוט ימשיך להמציא טקסט ולא יעצור בעצמו.

אפשר להריץ אותו על מחשב נייד חזק?

אין סיכוי. אפילו בגרסה המכווצת ביותר שלו נדרשים מעל שבעים גיגה בייט של זיכרון פנוי כדי לטעון את המשקלים. מדובר במפלצת שמחייבת שרת ייעודי או כמה כרטיסים גרפיים מקצועיים.

איך מריצים

כדי להריץ את המודל המקורי ברמת דיוק מלאה תצטרכו מאתיים ושישים גיגה בייט של זיכרון גרפי, מספר שלא קיים כמעט באף שרת רגיל. בגרסאות המכווצות של המאגר הזה, כמו int4, הדרישה יורדת לאזור שבעים ושלושה גיגה בייט זיכרון גרפי, מה שמאפשר לפצל את הטעינה בין כמה כרטיסים חזקים.

מריצים אותו בפועל דרך כלי שורת הפקודה של llama.cpp על ידי הורדת הקבצים הספציפיים שצריכים, למשל קובצי Q2_K, במקום למשוך את כל המאגר ששוקל מעל טרה בייט. אם אין לכם חומרה ייעודית עם עשרות גיגות זיכרון, עדיף להשתמש בספק שמגיש אותו בחיבור מרוחק.

ollama run hf.co/MaziyarPanahi/Mixtral-8x22B-v0.1-GGUF:Q5_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

73 קבצים במאגר, 1.2 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0, מה שנותן חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לכייל אותו מחדש ולהטמיע אותו במוצרים שלכם בלי תמלוגים, כל עוד שומרים על תנאי הרישיון ומתן הקרדיט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗