GPT
P

Phi-3-mini-4k-instruct

קוד פתוח

microsoftmit2024-04-22

  • transformers
  • safetensors
  • phi3
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל קומפקטי שמציג יכולות היגיון ומתמטיקה ברמה של מודלים כבדים בהרבה. הוא מתאים למי שחייב ביצועים טובים על חומרה מוגבלת בלי לשלם על שרתים יקרים.

  • 3.8Bפרמטרים
  • 4,096טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 464,337הורדות בחודש

מה זה

מדובר במודל שפת צד-שרת קטן עם 3.8 מיליארד פרמטרים, שמיקרוסופט אימנה על שילוב של מידע רשת מסונן מאוד ודאטה סינתטי שנועד ללמד חשיבה לוגית. בגרסת יוני 2024 שלו הוא קיבל שיפור חד בהבנת הוראות, במיוחד בהחזרת פלט מובנה, כשהציון שלו במבחן פלט JSON זינק מ־11.5 ל־52.3, וב־XML מ־14.4 ל־49.8.

התוצאות במבחנים מראות פער ברור ביחס לגודל. במבחן GSM8K שבודק פתרון בעיות במתמטיקה הוא מקבל 85.7, תוצאה שעוקפת מודלים כמו Llama-3-8B ואפילו מתקרבת ל־GPT-3.5-Turbo, למרות שהוא שוקל חצי מהם. הוא מצטיין גם בהבנת קוד פייתון פשוט, אבל מקריב ידע כללי רחב כדי להישאר קל משקל.

מתאים ל

  • חילוץ מידע למבנה JSON

    הקפיצה לציון 52.3 במבחני פלט מובנה מאפשרת להשתמש בו לפרסור טקסט ומיפוי שדות ישירות לתוך קוד.

  • פתרון בעיות היגיון במכשיר קצה

    הוא מציג ציון 85.7 במתמטיקה למרות גודל של 3.8B, ולכן מתאים למערכות שרצות אופליין על לפטופים.

  • בוט שיחה קצר באנגלית

    פורמט השיחה שכולל תמיכה בתגית המערכת עבר כוונון ייעודי לדיאלוגים מרובי שלבים במסגרת 4,096 טוקנים.

איפה זה נופל

החולשה הכי בולטת שלו היא חוסר בידע עובדתי. בגלל הממדים שלו הוא פשוט לא מכיל מספיק זיכרון לעובדות עולם, מה שרואים בבירור בציון הנמוך במבחן TriviaQA של 61.4 לעומת מעל 80 במודלים גדולים יותר. בנוסף, הוא אומן בעיקר על אנגלית וצרפתית ולא מתאים לשימוש בעברית. הידע שלו בקוד מוגבל כמעט רק לפייתון עם ספריות סטנדרטיות, כך שלא כדאי לסמוך עליו בשפות אחרות בלי בדיקה ידנית, וחלון ההקשר קצר מדי לניתוח קבצים שלמים.

אותה משפחה

Phi-3-mini יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

הוא לא מתאים למשימות בעברית. כרטיס המודל מצהיר במפורש על תמיכה באנגלית וצרפתית בלבד, ואימון המודל התמקד בעיקר באנגלית סטנדרטית כך שכל שפה אחרת תציג ביצועים ירודים משמעותית.

מה ההבדל בינו לבין גרסת ה־128K?

ההבדל היחיד הוא גודל חלון ההקשר שהמודל מסוגל לקרוא בכל הרצה. גרסת ה־4K מוגבלת לטקסטים קצרים יחסית, בעוד גרסת ה־128K מסוגלת לקבל מסמכים ארוכים בהרבה על אותה ארכיטקטורה של 3.8 מיליארד פרמטרים.

האם אני חייב כרטיס מסך יקר של אנבידיה כדי להשתמש בו?

ממש לא. הקבצים המקוריים שוקלים 7.1 ג'יגה בפורמט מלא, אבל מיקרוסופט שחררה גרסאות בפורמט ONNX ו־GGUF שמאפשרות להריץ אותו באינטגרציית 4 ביט על גבי מעבדים רגילים, מחשבים ניידים ומכשירי מובייל.

איך מריצים

המשקל המקורי בפורמט bfloat16 תופס 7.1 ג'יגה-בייט, כך שכרטיס מסך בודד עם 12 או 16 ג'יגה זיכרון יחזיק אותו בקלות. מיקרוסופט בדקה אותו על חומרות כמו A100, A6000 ו־H100 עם Flash-Attention, אבל אם יש לכם חומרה ישנה יותר כמו V100 תצטרכו להגדיר מימוש eager. קיימות גם גרסאות מקוונטטות רשמיות בפורמטים ONNX ו־GGUF שמאפשרות להריץ אותו מקומית על מעבדי מחשב רגילים וסלולר.

הגרסה הזו מוגבלת לחלון של 4,096 טוקנים בלבד. אם אתם צריכים לסכם מסמכים ארוכים עדיף לקחת את גרסת ה־128K של אותו המודל, ואם אתם לא רוצים לתחזק שרתים מקומיים, אפשר לפנות אליו ישירות דרך Azure AI Studio.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3-mini-4k-instruct")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון MIT מלא. זה אומר שמותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור, לשנות אותו, ולהפיץ אותו חופשי. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים המקורית והסרת אחריות של מיקרוסופט על תוצרי המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗