GPT
P

Phi-3-mini-128k-instruct

קוד פתוח

microsoftmit2024-04-22

  • transformers
  • safetensors
  • phi3
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המודל מציע שילוב נדיר בין משקל זעיר לבין חלון הקשר עצום, מה שהופך אותו לפתרון מעולה למי שרוצה לעבד מסמכים ארוכים מקומית. הוא מצטיין בהיגיון ובקוד בלי לדרוש שרת ייעודי כבד.

  • 3.8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.1 GBמשקל הקבצים
  • 293,225הורדות בחודש

מה זה

מדובר במודל שפת טקסט קומפקטי שמכוון לביצועים חזקים במיוחד של היגיון, מתמטיקה ותכנות, תוך שימוש במעט מאוד משאבים. מייקרוסופט אימנה אותו על נתונים סינתטיים איכותיים לצד טקסט מסונן מהרשת, במטרה לפצות על הגודל הפיזי הקטן באמצעות חומרי לימוד דחוסים וממוקדים.

במדדי ביצועים הוא עוקף מודלים כפולים ממנו בגודל, ובגרסת העדכון הזו הוא מציג זינוק חד ביכולת לפלוט מבנים מוגדרים: הציון שלו במבנה JSON קפץ מ־1.9 ל־60.1. במבחני הבנת קוד בהקשר ארוך הוא מגיע לתוצאה ממוצעת של 77 נקודות לעומת 32.4 בגרסה המקורית, כך שהוא מחזיק רצף הגיוני לאורך טקסטים כבדים בהרבה מהמקובל בקטגוריה.

מתאים ל

  • ניתוח מסמכים ארוכים

    תמיכה ב־128 אלף טוקנים מאפשרת לעבד חוזים ותמלילי פגישות באנגלית על חומרה מקומית צנועה.

  • עוזר פיתוח מקומי

    התוצאות שלו ב־RepoQA מעידות על הבנה חזקה של קוד ופרויקטים שלמים בלי צורך בחיבור לרשת.

  • חילוץ מידע מובנה

    המודל עבר התאמה מיוחדת לפליטת JSON תקין מתוך טקסטים ארוכים, עם זינוק מוכח בביצועי הפורמט.

איפה זה נופל

החולשה העיקרית נובעת ישירות מנפח הפרמטרים: פשוט אין לו מקום לשמור עובדות וידע כללי על העולם, כפי שמשתקף בציון נמוך של 35.8 במבחני ידע לעומת מודלים מתחרים. הוא מאומן באנגלית בלבד וביצועיו בשפות אחרות, כולל עברית, ירודים באופן מובהק. בנוסף, הקוד שהוא מייצר נשען בעיקר על פייתון עם ספריות ליבה סטנדרטיות, כך ששימוש בשפות אחרות או חבילות מורכבות מחייב בדיקה ידנית זהירה מחשש להזיות.

אותה משפחה

Phi-3-mini יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להשתמש במודל הזה לעיבוד טקסטים בעברית?

לא. המודל אומן והותאם ספציפית לאנגלית, ולכן התוצאות בעברית יהיו חלשות, שבורות ומלאות שגיאות תחביר והבנה.

איך מחברים אותו לפרויקט שצריך תשובות מדויקות על עובדות?

הוא מתקשה לזכור עובדות בעצמו, ולכן חובה לשלב אותו בארכיטקטורת RAG יחד עם מנוע חיפוש או בסיס נתונים שמספקים את המידע בהקשר.

איך מריצים

המשקל הגולמי של הקבצים עומד על 7.1 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך ביתי בודד עם 12 גיגה בייט זיכרון יספיק לטעינה בסיסית. כברירת מחדל ההרצה דורשת שימוש ב־Flash-Attention שנבדק רשמית על כרטיסי שרת כמו A100, A6000 או H100, אבל אפשר להפעיל מימוש eager ישיר עבור כרטיסים ישנים יותר. למי שמכוון למכשירים ניידים או מעבדים רגילים, קיימות גרסאות ONNX מכווצות בקוונטיזציה של int4.

אם אתם צריכים להריץ שאילתות בודדות עם חלון מלא של 131,072 טוקנים, מומלץ לגשת אליו דרך Azure AI Studio ולא לחנוק את הזיכרון המקומי. פתיחת החלון המלא דורשת משאבי זיכרון גרפי משמעותיים מעבר לגודל המודל עצמו.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3-mini-128k-instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT מלא, וזה אומר שאתם חופשיים לעשות בו כמעט הכל. מותר להשתמש בו לצרכים מסחריים, לשלב אותו בתוך מוצר סגור, לשנות את המשקלים ולהפיץ אותו מחדש, כל עוד אתם משאירים את הודעת זכויות היוצרים המקורית של מייקרוסופט. שימו לב שהסימנים המסחריים של החברה אינם כלולים ברישיון הזה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗