GPT
P

Phi-3.5-MoE-instruct

קוד פתוח

microsoftmit2024-08-17

  • transformers
  • safetensors
  • phimoe
  • text-generation
  • nlp

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מודל תערובת מומחים של מיקרוסופט שמפעיל רק 6.6 מיליארד פרמטרים בכל טוקן מתוך 42 מיליארד בסך הכול. הוא נותן היגיון חזק ומהירות תגובה גבוהה בלי לדרוש כוח חישוב של מודלי ענק.

  • 42Bפרמטרים
  • 131,072טוקנים בהקשר
  • 78.0 GBמשקל הקבצים
  • 120,301הורדות בחודש

מה זה

הארכיטקטורה כאן מחלקת 42 מיליארד פרמטרים לשישה עשר מומחים קטנים, ומנתבת כל שאלה לשניים בלבד. במקום לסחוב משקל מלא של מודל ענק בכל ריצה, אתם מקבלים זמן תגובה של מודל קטן עם יכולות הסקת מסקנות שמגרדות את GPT-4o-mini. במבחני היגיון כמו ARC Challenge הוא מגיע לציון 91, ובמתמטיקה קשה הוא עוקף בקלות מודלים פתוחים של שמונה ושתים עשרה מיליארד פרמטרים.

האימון שלו נשען על 4.9 טריליון טוקנים של מידע סינתטי מסונן בקפידה, עם תמיכה מובנית בחלון הקשר של 128 אלף טוקנים. הוא מכוון ישירות לפיתוח קוד, פתרון בעיות לוגיות וניתוח טקסטים ארוכים, אבל לא מנסה לשמש אנציקלופדיה מהלכת.

מתאים ל

  • ניתוח קוד וריפוזיטוריז

    מגיע לציון 85 בבנצ'מרק RepoQA, ומתמודד מצוין עם קבצי קוד מרובים בתוך חלון ההקשר הארוך.

  • מנועי RAG ארגוניים

    הוא מבריק בהיגיון וניתוח טקסט, וברגע שמזריקים לו מסמכים מבחוץ עוקפים את חולשת הזיכרון העובדתי שלו.

  • סיכום פגישות ומסמכים ארוכים

    תומך ב־128 אלף טוקנים ברמת שליפה טובה, ומאפשר עיבוד פרוטוקולים בלי צורך לחתוך את הטקסט.

איפה זה נופל

החיסרון המרכזי נובע ישירות מהגודל הפעיל שלו. כיוון שרק 6.6 מיליארד פרמטרים פעילים, אין לו מקום פיזי לאחסן ידע עובדתי רחב, והוא נוטה להמציא עובדות בביטחון מלא. מיקרוסופט מציינים מפורשות שחייבים לחבר אותו למנוע חיפוש או למערכת RAG כדי לקבל תשובות מדויקות היסטורית ומדעית.

בנוסף, יצירת הקוד מוגבלת בעיקר לפייתון עם ספריות סטנדרטיות, ושימוש בחבילות אחרות דורש בדיקה ידנית של כל פקודה. בשיחות צ'אט ארוכות התשובות עלולות להיעשות חזרתיות, ויש ירידה ברמת הדיוק בשפות שאינן אנגלית, למרות התמיכה הרשמית בעברית.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב ביתי חזק עם RTX 4090 בודד?

לא. למרות שרק חלק קטן מהמודל פעיל בכל רגע, כל 42 מיליארד הפרמטרים חייבים לשבת בתוך הזיכרון של כרטיס המסך. כרטיס עם 24 גיגה בייט לא יצליח אפילו לטעון את המשקלים של המודל המקורי ללא קוונטיזציה כבדה מאוד.

איך הביצועים שלו בעברית מול מודלים אחרים?

הוא תומך בעברית ונכלל ברשימת השפות הרשמית, אבל המפתחים מודים שביצועי השפות שאינן אנגלית נמוכים יותר. בנוסף, מנגנוני הסינון והבטיחות שלו פחות יציבים בשפות זרות ועלולים להחזיר סירובים באנגלית גם לשאלות שנשאלו בעברית.

איך מריצים

כדי להריץ אותו מקומית צריך לזכור שארכיטקטורת מומחים חוסכת חישוב, לא זיכרון. הקבצים שוקלים 78 גיגה בייט בדיוק bfloat16, מה שאומר שחייבים לפחות 80 גיגה בייט של VRAM רק כדי לטעון אותו לזיכרון לפני שפותחים חלון הקשר ארוך. מיקרוסופט בדקו אותו על גבי A100, A6000 ו־H100, והוא דורש Flash-Attention מותקן לצד גרסת transformers 4.46 ומעלה.

אם אין לכם כרטיס שרת ייעודי או לפחות שני כרטיסים מקצועיים מחוברים, אין טעם לנסות להריץ אותו על מחשב מקומי. עדיף בהרבה להשתמש בו ישירות דרך Azure AI Studio או API מנוהל אחר.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3.5-MoE-instruct")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון MIT מלא. אפשר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, לעשות לו fine-tuning, ולהפיץ אותו בתוך מוצרים סגורים בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים של מיקרוסופט בקבצים המקוריים, תוך הקפדה לא להשתמש בסימני המסחר שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗