GPT
P

Phi-3.5-mini-instruct

קוד פתוח

microsoftmit2024-08-16

  • transformers
  • safetensors
  • phi3
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל קומפקטי של 3.8 מיליארד פרמטרים שמציע חלון הקשר ענק של 128 אלף טוקנים. הוא פונה למי שרוצה יכולות היגיון וקוד חזקות בלי להחזיק שרת כבד.

  • 3.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 350,922הורדות בחודש

מה זה

מיקרוסופט אימנה את הגרסה הזו על 3.4 טריליון טוקנים תוך התמקדות בנתונים סינתטיים צפופי היגיון ובאיכות גבוהה של טקסט מסונן. המטרה כאן היא לדחוס כמה שיותר יכולת שכלית לתוך גודל זעיר יחסית, במקום לשפוך פנימה עובדות כלליות על העולם. החלון של 128 אלף טוקנים נדיר מאוד בקטגוריית המשקל הזו ומאפשר לעבד מסמכים ארוכים או קטעי קוד גדולים.

במבחני הביצועים הוא עוקף מודלים כפולים מגודלו. במבחן RepoQA להבנת קוד בהקשר ארוך הוא מגיע לציון ממוצע של 77, מעל Llama-3.1-8B שעומד על 71 ומעל Mistral-7B שעומד על 62. במבחני מתמטיקה כמו GSM8K הוא משיג 86.2, שוב גבוה משמעותית ממתחרים בקטגוריית 7B עד 12B. עם זאת, במבחני שפה כלליים ורב לשוניים כמו Multilingual MMLU הוא עומד על 55.4 בלבד, כך שהפוקוס שלו נשאר מאוד אנליטי וטכני.

מתאים ל

  • ניתוח בסיסי קוד

    הוא משיג תוצאה של 77 במבחן RepoQA ומאפשר סריקת קבצים רבים בתוך חלון ההקשר הארוך.

  • פתרון בעיות מתמטיקה

    עם ציון של 86.2 ב־GSM8K הוא מספק יכולת חישוב והיגיון שגוברת על מודלים של 7B ו־8B.

  • שירות ברוחב פס מוגבל

    משקל של 7.1 ג'יגה בייט בלבד מאפשר להריץ אותו בעלות תשתית נמוכה וזמן תגובה מהיר.

איפה זה נופל

המודל אומן בעיקר על אנגלית, וסובל מנחיתות מורגשת בשפות אחרות למרות התמיכה הרשמית בהן. בייצור קוד, עיקר הנתונים שלו מבוססים על פייתון וחבילות בסיסיות, כך שבשפות תכנות אחרות או בספריות חיצוניות נדירות הוא נוטה להזות שימושי API שגויים לחלוטין. כמו כן, בשיחות צ'אט ממושכות מופיעה תופעה של סחיפה, חזרתיות וירידה בעקביות התשובות. במבחן השליפה RULER בדיוק של 128 אלף טוקנים הוא צונח לציון 63.6 לעומת 94.3 בהקשר קצר.

אותה משפחה

Phi-3.5-mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לעיבוד טקסטים בעברית?

עברית רשומה ברשימת השפות הנתמכות, אך כרטיס המודל מבהיר שאיכות הפלט בשפות שאינן אנגלית נמוכה יותר. לא מומלץ להסתמך עליו למשימות ניסוח כבדות בעברית בלי בדיקה ובחינה מוקדמת של התוצאות.

האם אפשר להריץ אותו על מחשב נייד מקומי?

כן, המשקלים תופסים כ־7.1 ג'יגה בייט בזיכרון, כך שמחשב מודרני עם כרטיס מסך ביתי או מחשב מק עם זיכרון מאוחד של 16 ג'יגה בייט יריץ אותו בקלות. עם זאת, ניצול מלא של חלון ה־128 אלף טוקנים ידרוש נפח זיכרון נוסף.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.1 ג'יגה בייט בפורמט bfloat16, מה שאומר שאפשר לטעון אותו על כרטיס מסך בודד של 12 עד 16 ג'יגה בייט בלי דחיסה מיוחדת, באמצעות ספריית transformers מגרסה 4.43.0 ומעלה ומומלץ עם flash attention 2. מי שמעדיף ישירות בענן יכול לגשת אליו דרך Azure AI Studio.

אם אתם רוצים לפרוס אותו למשתמשי קצה על חומרה זולה, בגודל כזה הרצה מקומית משתלמת מאוד מבחינת עלויות שרת. הפנייה לפתרון ענן חיצוני דרך API עדיפה בעיקר אם אתם מתכננים לנצל בעקביות את כל 128 אלף הטוקנים של ההקשר, שם צריכת הזיכרון לניהול ה־KV cache כבר תדרוש כרטיסים מקצועיים וחזקים בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3.5-mini-instruct")
print(pipe("שלום"))

הרישיון

רישיון MIT חופשי ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים או מחקריים, לשנות את המשקלים, לאמן עליו ולשלב אותו בתוך מוצרים סגורים, בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית של מיקרוסופט בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗