GPT
P

phixtral-4x2_8

קוד פתוח

mlabonnemit2024-01-08

  • transformers
  • safetensors
  • phi-msft
  • text-generation
  • moe

שילוב של ארבעה מודלים מבוססי phi-2 לתוך ארכיטקטורת מומחים אחת. הוא מיועד למי שמחפש ביצועים משופרים בלי לעבור למודלי ענק.

  • 7.8Bפרמטרים
  • 2,048טוקנים בהקשר
  • 14.6 GBמשקל הקבצים
  • 69הורדות בחודש

מה זה

הפרויקט הזה לוקח ארבע גרסאות שונות שעברו כוונון עדין של phi-2, ומחבר אותן באמצעות mergekit למבנה של תערובת מומחים. הרעיון נשען על השיטה של מיקסטרל, כאשר המודל מפעיל שני מומחים מתוך הארבעה עבור כל טוקן. הבסיס כולל גרסאות כמו dolphin וגרסת קוד, כך שהשילוב מכסה כמה כיוונים במקביל.

במבחני הביצועים של Nous, המודל מגיע לממוצע של 47.7 נקודות. הנתון הזה מציב אותו מעל כל אחד מארבעת המומחים הבודדים שנכנסו להרכבה, כולל מודל המקור של מיקרוסופט שעומד על 44.61. השיפור הבולט ביותר נרשם במבחן AGIEval, שם הוא מגיע ל־33.91 לעומת פחות מ־28 במקור.

מתאים ל

  • שרת מקומי דל משאבים

    מאפשר הרצה של ארכיטקטורת מומחים מלאה על חומרה צנועה כמו מאיץ T4 באמצעות כימות מתאים.

  • שאלות ותשובות באנגלית

    מציג ציונים עדיפים על מודל הבסיס במבחני ידע וחשיבה כמו AGIEval ו־TruthfulQA.

  • משימות טקסט נקודתיות

    עובד היטב על פניות קצרות ועיבוד קטעים ממוקדים שלא חורגים ממגבלת 2,048 הטוקנים.

איפה זה נופל

החיסרון המרכזי והברור הוא חלון הקשר של 2,048 טוקנים בלבד. אי אפשר להזין כאן מסמכים ארוכים, היסטוריית שיחה עשירה או קטעי קוד נרחבים. בנוסף, המודל אומן ותועד באנגלית בלבד, כך שאין כאן תמיכה בעברית. חיסרון טכני נוסף נובע מזה שמדובר במיזוג נסיוני עם קוד ייעודי, מה שעלול לייצר בעיות יציבות באינטגרציה רגילה.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל מוגדר רשמית לשפה האנגלית בלבד, וכל המומחים שהרכיבו אותו אומנו באנגלית. לא כדאי לבנות עליו לעיבוד או יצירת תוכן בעברית.

מה היתרון שלו מול phi-2 הרגיל?

הוא מציג תוצאות גבוהות יותר בכל מדדי המבחן שנבדקו, בזכות חיבור ארבעה מודלים מתמחים. בממוצע Nous הוא משיג 47.7 נקודות לעומת 44.61 במודל הבסיס.

האם אפשר להריץ אותו דרך ספריית transformers הרגילה?

כן, אך הריצה נשענת על קוד מותאם אישית שנמצא במאגר ומגדיר את שכבת המומחים. הקונפיגורציה קובעת שימוש בשני מומחים פעילים מתוך הארבעה עבור כל טוקן.

איך מריצים

כדי להריץ אותו בקבצי ה־float16 המקוריים צריך זיכרון שיחזיק 14.6 ג'יגה־בייט של משקלים, לפני שמחשבים את זיכרון ההקשר. המפתח מציע מחברת קולאב שמריצה אותו בכימות של 4 ביט על גבי כרטיס T4 חינמי, ויש גם גרסת GPTQ ייעודית של TheBloke למי שרוצה לצמצם משאבים.

אם אתם לא רוצים להתעסק עם קוד הסקת מסקנות מותאם אישית שנכתב במיוחד למיזוג הזה, שירותי ענן עם מודלים פתוחים סטנדרטיים יחסכו זמן. המודל דורש טעינה של קבצי פייתון מקומיים מתוך המאגר כדי לנהל את ניתוב המומחים.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlabonne/phixtral-4x2_8")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר לעשות איתו כמעט הכל, כולל שימוש מסחרי, שינוי הקוד והפצה פנימית או מסחרית בתוך מוצר. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית של הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗