GPT
M

Mistral-22B-v0.1

קוד פתוח

Vezoraapache-2.02024-04-11

  • transformers
  • safetensors
  • mistral
  • text-generation
  • conversational

דחיסה נסיונית של מודל תערובת מומחים שלם לרשת צפופה אחת בגודל 22 מיליארד פרמטרים. פתרון למי שרוצה לבדוק מחקר של זיקוק ידע בלי להחזיק ארכיטקטורת מומחים מסובכת.

  • 22Bפרמטרים
  • 65,536טוקנים בהקשר
  • 41.4 GBמשקל הקבצים
  • 70הורדות בחודש

מה זה

ניקולס מחברת וזורה לקח את מודל המומחים Mixtral-8x-22b יום אחרי שיצא, ודחס את כל שמונת המומחים לרשת צפופה רגילה של 22 מיליארד פרמטרים. במקום לנתב טוקנים בין מסלולים שונים, הוא זיקק ידע מכל המומחים לתוך מודל יחיד עם 56 שכבות. לפי היוצר, מדובר בהמרה הראשונה שעובדת מתצורת תערובת מומחים למודל צפוף.

המודל אומן באמצעות אנבלות' כדי לחסוך זיכרון ולהאיץ את התהליך, אבל האימון הנוכחי מינימלי ונמשך פחות משעה. הוא נשען על 500 שאלות ותשובות אנושיות ועוד 500 דוגמאות פייתון בדוקות בלבד. היוצר מציין יכולת מתמטית טובה למרות שלא עבר אימון ייעודי לתחום, אך מבהיר שרמת הביצועים הכללית מזכירה כרגע את לאמה 1 ולא מעבר לזה.

מתאים ל

  • מחקר דחיסת מודלים

    בדיקת ההשפעה של זיקוק שמונה מומחים לרשת צפופה אחת והבנת מגבלות השיטה בפועל.

  • ניסויי פתרון תרגילים

    בחינת יכולות מתמטיקה נקודתיות שהפגינה הרשת למרות שלא אומנה לכך במפורש.

  • אימון המשך עצמאי

    בסיס התחלתי להתאמה נוספת עם מערכי נתונים פרטיים בספריית טרנספורמרס.

איפה זה נופל

היוצר כותב במפורש שלא כדאי לצפות לתוצאות מרשימות ומגדיר את זה כניסוי ראשוני בלבד. האימון ארך פחות משעה על אלף דוגמאות בסך הכל. אין כאן תמיכה בשיחות מרובות שלבים, אין יכולת כתיבת קוד מורכבת, אין מצב פלט במבנה ג'ייסון, ואין יכולות סוכנים. בנוסף, דחיסה של שמונה מומחים למודל אחד עלולה לגרום לאובדן זיכרון וידע.

אותה משפחה

Mistral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים להרצה במוצר פעיל?

לא. היוצר עצמו מגדיר אותו כניסוי מהיר של שעה אחת עם אלף דוגמאות אימון, ומציין שהביצועים דומים למודלים ישנים מדור לאמה 1. חסרות בו יכולות שיחה ופלט מובנה.

במה הוא שונה מגרסת המומחים של מיסטרל?

הוא לא מפעיל מנגנון ניתוב מומחים בזמן ריצה אלא כולל רשת צפופה רגילה אחת. כל הידע משמונת המומחים נדחס פנימה לגודל יחיד של 22 מיליארד פרמטרים.

איך מריצים

המשקל הכולל של 19 הקבצים הוא 41.4 ג'יגה בייט בדיוק bfloat16, כך שתצטרכו כרטיס מסך עם זיכרון וידאו גדול מספיק להחזיק מעל 40 ג'יגה בייט רק בשביל המשקלים, עוד לפני שמחשבים את חלון ההקשר. המודל נתמך ישירות בספריית טרנספורמרס תחת הארכיטקטורה הרגילה של מיסטרל.

אם אין לכם חומרה ייעודית כבדה מקומית, עדיף להמתין או לפנות למודלים מבוססים שמוגשים כשירות ענן. מדובר בגרסת בדיקה ראשונה ששוחררה בחופזה בגלל ניסיונות שכפול ברשת, והיא דורשת משאבים של מודל מלא בלי להציע עדיין יציבות שמתאימה לסביבת עבודה שוטפת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Vezora/Mistral-22B-v0.1")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים, הפצה והרצה פנימית בלי תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗