GPT
P

Phi-3-small-8k-instruct

קוד פתוח

microsoftmit2024-05-07

  • transformers
  • safetensors
  • phi3small
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל 7.4B של מיקרוסופט שמביא ביצועי היגיון וקוד חריגים לגודל שלו. מי שבוחר בו רוצה יכולת עיבוד מקומית חזקה בלי לשלם על מודל ענק.

  • 7.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 13.8 GBמשקל הקבצים
  • 19,843הורדות בחודש

מה זה

המודל אומן על 4.8 טריליון טוקנים, כשחלק ניכר מהדאטה סינתטי ואיכותי לצד סינון אגרסיבי של הרשת. מיקרוסופט הורידו בכוונה עובדות טריוויה כמו תוצאות משחקי ספורט כדי לפנות נפח להיגיון, קוד ומתמטיקה. הוא עבר כוונון להוראות עם SFT ו־DPO ומחזיק חלון הקשר של 8,192 טוקנים.

במבחנים התוצאות מראות בדיוק את הבחירה הזו. ב־GSM8K של מתמטיקה הוא מקבל 89.6, מעל Mixtral 8x7B ו־Llama 3 8B. ב־HumanEval של פייתון הוא עומד על 61.0. מנגד, במבחן TriviaQA הוא משיג רק 58.1, נמוך בהרבה מרוב המתחרים, כי פשוט חסר לו ידע כללי שנמחק באימון.

מתאים ל

  • פתרון בעיות היגיון ומתמטיקה

    תוצאה של 89.6 ב־GSM8K מאפשרת לו לפרק שאלות חישוביות מורכבות ביעילות גבוהה מחלופות מקומיות.

  • כתיבת סקריפטים בפייתון

    מתאים לאוטומציות קוד פנימיות בזכות התמקדות בספריות הליבה של פייתון וציון 61.0 ב־HumanEval.

  • הרצה מקומית על כרטיסי עבודה

    מתאים לתחנות מבוססות A6000 שדורשות כלי הוראות מהיר עם הקשר של 8K בלי תלות ברשת.

איפה זה נופל

החולשה הכי בולטת היא ידע כללי ועובדות. במבחן factual knowledge הוא קיבל 38.6 בלבד, הציון הנמוך ביותר בהשוואה. בנוסף, האימון התמקד בעיקר באנגלית. רק עשרה אחוזים מהדאטה היו רב לשוניים, כך שאי אפשר לבנות עליו לעברית שוטפת בלי בדיקה מעמיקה.

בקוד, רוב החומר היה פייתון עם ספריות סטנדרטיות כמו typing ו־itertools. אם תבקשו שפות אחרות או חבילות צד שלישי, מיקרוסופט עצמם מזהירים לבדוק ידנית כל קריאת API כי הסיכוי להזיות עולה. תאריך היעד של המידע שלו הוא אוקטובר 2023.

אותה משפחה

Phi-3-small יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש בו לשאלות ותשובות על מידע כללי?

לא. החוקרים מחקו בכוונה עובדות רבות מדאטה האימון כדי לחסוך מקום, ובמבחן TriviaQA הוא נפל ל־58.1. למטרות ידע כללי עדיף להצמיד לו רכיב RAG או לבחור מודל אחר.

איך המודל מתמודד עם טקסט בעברית?

המודל מוגדר רב לשוני אך רק עשרה אחוזים מהדאטה כללו שפות שאינן אנגלית, והמפתחים מציינים ביצועים פחותים מחוץ לאנגלית תקנית. אם המערכת שלכם מיועדת לעברית, תצטרכו לבדוק את איכות הפלט בעצמכם לפני שימוש.

איך מריצים

כדי להריץ אותו דרך transformers נדרשים tiktoken בגרסה 0.6.0, triton 2.3.0 והפעלת trust_remote_code. ברירת המחדל כוללת Flash-Attention 2 ו־blocksparse attention, ולכן מיקרוסופט בדקו אותו על כרטיסי שרת בלבד: A100, A6000 ו־H100. קבצי המשקלים ב־bfloat16 שוקלים 13.8 גיגה בייט.

למי שמכוון למחשבים אישיים, מעבדים או מכשירים ניידים, קיימות גרסאות ONNX מכוונות עם קוונטיזציה ל־int4 דרך AWQ ו־RTN. המודל זמין גם ב־Azure AI, כך שאם אין לכם GPU תואם או שאתם לא רוצים לנהל את התלויות הייעודיות, קריאה לשירות ענן תהיה פשוטה יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3-small-8k-instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, אחד המתירניים ביותר שיש. אפשר להשתמש בו חופשי לפרויקטים מסחריים, לשלב אותו בקוד סגור, לשנות את המשקלים ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗