GPT
P

phixtral-2x2_8

קוד פתוח

mlabonnemit2024-01-07

  • transformers
  • safetensors
  • phi-msft
  • text-generation
  • moe

שילוב של שני מודלי Phi-2 בארכיטקטורת מומחים קלה. הוא מציע ביצועים שעוקפים את מודלי המקור בלי לדרוש משאבי שרת כבדים.

  • 4.5Bפרמטרים
  • 2,048טוקנים בהקשר
  • 8.3 GBמשקל הקבצים
  • 84הורדות בחודש

מה זה

הפרויקט הזה לוקח שני כיוונונים שונים של המודל הקטן של מיקרוסופט, אחד מבוסס Dolphin והשני עבר DPO, ומחבר אותם למבנה של תערובת מומחים בעזרת Mergekit. הרעיון הוא לקבל איכות גבוהה יותר בלי לשלם את המחיר החישובי של מודל ענק רגיל.

במבחני הביצועים של Nous, השילוב הזה עוקף את המודלים הבודדים שהרכיבו אותו עם ממוצע של 47.78 לעומת 44.61 במודל הבסיס המקורי. השיפור מורגש במיוחד במבחן AGIEval, שם הוא קופץ מציון 27.98 לציון 34.1, מה שמראה הבנה טובה יותר של משימות מורכבות יותר באנגלית.

מתאים ל

  • הסקה מקומית על כרטיס פשוט

    רץ בקוונטיזציה על כרטיס T4 בודד ומתאים למכונות קצה ללא שרתי ענן יקרים.

  • משימות טקסט קצרות באנגלית

    מציג ציונים עדיפים על מודלי Phi רגילים בטקסטים שלא עוברים 2,000 טוקנים.

  • ניסויי ארכיטקטורת מומחים

    בסיס טוב לבדיקת שילוב מודלים מקומי לפני מעבר למודלי ענק מורכבים.

איפה זה נופל

חלון ההקשר עומד על 2,048 טוקנים בלבד. למי שבונה על שליפת מסמכים ארוכים או שיחות מורכבות, המגבלה הזו תורגש מיד. הוא אומן רק על אנגלית, כך שאין מה לבנות עליו לעבודה בעברית ללא כוונון נוסף. בנוסף, מדובר בניסוי של מיזוג מודלים עם קוד מותאם אישית, ולא במוצר מהודק שעבר בדיקות בטיחות מקיפות.

שאלות
נפוצות

האם הוא מבין עברית?

המודל הוגדר ואומן עבור השפה האנגלית בלבד. אם תפנו אליו בעברית הוא כנראה ייכשל לחלוטין או יחזיר תשובות משובשות, ולא הייתי בונה עליו לשום שימוש בשפה המקומית.

איך שני מומחים עובדים יחד בפועל?

הקונפיגורציה מגדירה שני מומחים מקומיים ושניהם מופעלים עבור כל טוקן כברירת מחדל. ניתוב המידע מתבצע בעזרת מנגנון הטמעה פשוט שמחליט איך לשלב את התשובות של שני המודלים.

איך מריצים

המודל שוקל 8.3 גיגה בייט בפורמט הרגיל שלו, ומריצים אותו ישירות דרך ספריית Transformers עם קוד הסקה מותאם לקבצים שנמצאים במאגר. אפשר להריץ אותו בקוונטיזציה של 4 ביט על כרטיס בסיסי כמו T4 בלי לשלם על שרתים יקרים.

אם אתם צריכים רק בדיקה מהירה, יש לו ספייס פתוח בהאגינג פייס. לשימוש מקומי שוטף הוא מתאים לכרטיס מסך בודד עם 12 או 16 גיגה זיכרון, ואין סיבה אמיתית לפנות לשרותי ענן חיצוניים בגודל כזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlabonne/phixtral-2x2_8")
print(pipe("שלום"))

הרישיון

הפרויקט מפורסם תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להריץ אותו במוצרים שלכם ולסגור את הקוד, כל עוד משאירים את הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗