GPT
P

Phi-3-medium-128k-instruct

קוד פתוח

microsoftmit2024-05-07

  • transformers
  • safetensors
  • phi3
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

דחיסה של 14 מיליארד פרמטרים עם חלון של 128 אלף טוקנים שמתמחה בלוגיקה ובקוד. פתרון ממוקד למי שצריך הרצה מקומית חזקה בלי לתחזק מפלצות של 70 מיליארד פרמטרים.

  • 14Bפרמטרים
  • 131,072טוקנים בהקשר
  • 26.0 GBמשקל הקבצים
  • 21,971הורדות בחודש

מה זה

מיקרוסופט אימנה את הדגם על 4.8 טריליון טוקנים, כשהדגש הושם על נתונים סינתטיים איכותיים וחומרי לימוד במקום שאיבה עיוורת של כל הרשת. המטרה כאן ברורה, לייצר יכולות הסקה וקוד גבוהות בגודל בינוני, במקום לבזבז נפח על ידע כללי וטריוויה. הוא עבר כוונון ייעודי להוראות ומדידות הבטיחות שלו נשענות על אופטימיזציית העדפות ישירה.

במבחני ביצועים הוא עוקף מודלים גדולים ממנו בהרבה במשימות היגיון ומתמטיקה. במבחן GSM8K הוא הגיע לציון 87.5, מעל Mixtral 8x22B וקרוב מאוד לגרסאות Llama 3 הגדולות. לעומת זאת, במבחני ידע עובדתי כמו TriviaQA הוא משיג 73.9 בלבד, נמוך משמעותית ממתחריו, מה שמוכיח שהסינון של המידע אכן פגע בזיכרון האנציקלופדי לטובת כושר חשיבה מופשט.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון של 128 אלף טוקנים מאפשר להזין תיקי מסמכים שלמים ולחלץ מסקנות בלי לחתוך את המידע לחלקים קטנים.

  • אוטומציית סקריפטים בפייתון

    אימון ייעודי על ספריות פייתון סטנדרטיות הופך אותו ליעיל בכתיבה, בדיקה והסבר של קוד תשתית.

  • פתרון בעיות לוגיות מורכבות

    יכולות הסקה גבוהות במיוחד ביחס לגודל של 14B, שמתאימות למערכות ניתוב נתונים ומענה מובנה.

איפה זה נופל

החולשה העיקרית היא ידע כללי ועובדות, תחום שבו הוא נופל בבירור מול מתחרים בגלל סינון נתונים אגרסיבי, לצד תאריך חיתוך מידע שנעצר באוקטובר 2023. הוא אומן בעיקר באנגלית, ולמרות התווית הרב לשונית, ביצועיו בשפות אחרות כמו עברית נמוכים באופן מורגש. בנוסף, יכולות הקוד שלו מרוכזות סביב שפת פייתון וחבילות בסיסיות, כך שכל יצירת קוד בשפות אחרות או שימוש בספריות מורכבות מחייבים בדיקה ידנית זהירה עקב נטייה להזיות.

אותה משפחה

Phi-3-medium יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי לבחור בגרסת 128K על פני גרסת 4K?

רק אם יש לכם צורך ממשי בהזנת טקסטים ארוכים במיוחד או שרשראות שיחה ממושכות. שימוש בחלון הגדול צורך משאבי זיכרון רבים ומאט את קצב יצירת הטקסט, כך שלמשימות פשוטות עדיף להישאר עם גרסת 4K.

האם המודל יתאים למוצר שפונה לקהל ישראלי בעברית?

לא מומלץ להסתמך עליו כמנוע מרכזי בעברית ללא כוונון נוסף. הוא אומן בעיקר על אנגלית והכרטיס הרשמי מציין במפורש ירידה בביצועים בכל שפה שאינה אנגלית.

איך מריצים

כדי להריץ אותו במשקל המקורי בפורמט bfloat16, תצטרכו לפחות 26 גיגה בייט של זיכרון גרפי רק למשקלים, ועוד תוספת נכבדה לניהול הקשר מלא של 128 אלף טוקנים. ברירת המחדל דורשת Flash-Attention, ולכן מיקרוסופט בדקה אותו רשמית על כרטיסי שרת מסוג A100, A6000 או H100. קוד הטעינה בספריית transformers מחייב שימוש בדגל trust_remote_code=True.

אם אין לכם חומרה כזו, קיימות גרסאות מכווצות בפורמט ONNX באינטגרציית int4 שרצות על מעבדים, מחשבים אישיים וכרטיסים קטנים יותר דרך DirectML. אם המטרה היא להרים שירות יציב בלי להשקיע אלפי דולרים בחודש על שרתי GPU כבדים, עדיף לצרוך אותו דרך Azure AI Studio.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3-medium-128k-instruct")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT מלא. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות את המשקלים, לשלב אותו בתוכנה קניינית ולהפיץ אותה ללקוחות בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗