GPT
P

Phi-3-mini-128k-instruct-onnx

קוד פתוח

microsoftmit2024-04-23

  • transformers
  • onnx
  • phi3
  • text-generation
  • ONNX

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסה ממוטבת של מודל קטן עם חלון הקשר ענק של 128 אלף טוקנים, שמיועדת לריצה מקומית מהירה ישירות דרך מנוע ONNX Runtime. היא נותנת ביצועי הסקה עדיפים על פני פייטקסט רגיל בלי להסתבך עם הגדרות שרת כבדות.

  • 131,072טוקנים בהקשר
  • 16.5 GBמשקל הקבצים
  • 159הורדות בחודש
  • 193לייקים

מה זה

המאגר מכיל המרה רשמית של המודל הקומפקטי ממשפחת Phi-3 לתבנית ONNX, כשהדגש כאן הוא על הסקה מואצת בחומרה מגוונת. המודל הבסיסי אומן על שילוב של דאטה סינתטי ואתרים מסוננים עם צפיפות חשיבה גבוהה, ועבר כוונון להוראות ואופטימיזציית העדפות ישירה. הייחוד של הגרסה המסוימת הזו הוא היכולת לבלוע מסמכים ארוכים מאוד בתוך מודל קל משקל שרץ כמעט בכל סביבה.

מבחני הביצועים של מיקרוסופט על כרטיס A100 מראים פערים חדים לטובת מנוע ONNX לעומת PyTorch Eager. בגרסת FP16 המנוע מגיע למהירות של עד פי חמישה, ובגרסת INT4 התאוצה מגיעה עד פי תשעה בפרומפטים קצרים. היתרון הגדול מתבטא בעומס: בזמן שפייטקסט קרס עם שגיאת חוסר זיכרון בבאץ של 16 עם פרומפט של 4096 טוקנים, מנוע ONNX המשיך לעבוד וסיפק קצב של מעל 190 טוקנים בשנייה.

מתאים ל

  • ניתוח מסמכים ארוכים במחשב מקומי

    חלון של 128 אלף טוקנים מאפשר לסכם קבצים גדולים ישירות על מעבד או כרטיס מסך ביתי בלי לשלוח מידע לענן.

  • תוכנות דסקטופ לחלונות

    תמיכה מובנית ב־DirectML מאפשרת להריץ מודל שפה מהיר על כרטיסי מסך של אינטל, AMD ואנבידיה עם מינימום 4 גיגה זיכרון.

  • הסקה מקומית באפליקציות מובייל

    גרסאות כימות ייעודיות מאפשרות להפעיל את המודל על מעבדי מכשירים ניידים כמו סמסונג גלקסי S21 ישירות דרך C++ או פייתון.

איפה זה נופל

המגבלה הכי משמעותית כרגע היא התאימות לכלי העבודה הנפוצים בשוק. התיעוד מבהיר במפורש ש־Llama.cpp ו־PyTorch compile אינם תומכים בגרסת ה־128K של המודל הזה. בנוסף, המאגר מפוצל ל־55 קבצים שונים בהיקף של 16.5 גיגה, מה שמחייב אתכם לבחור בדיוק את הקובץ שמתאים לארכיטקטורת החומרה ולרמת הדיוק הרצויה. גרסאות הכימות למעבדים מגיעות בשתי רמות דיוק נפרדות, ואתם תצטרכו לבדוק בעצמכם שהפגיעה באיכות התוכן בעקבות הכימות עדיין סבירה למשימה שלכם.

אותה משפחה

Phi-3-mini יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה באמצעות llama.cpp?

לא. כרטיס המודל מציין במפורש ש־Llama.cpp אינו תומך כרגע בגרסת Phi-3 Mini-128K-Instruct. כדי להריץ את הגרסאות שכאן, תצטרכו להשתמש בספריית onnxruntime ובחבילת onnxruntime-genai.

באיזו גרסת כימות כדאי לבחור אם אני מריץ על מעבד רגיל?

המאגר מציע שתי גרסאות כימות int4 למעבדים. גרסת Acc=1 שומרת על דיוק גבוה יותר של התשובות על חשבון מהירות, בעוד גרסת Acc=4 מוותרת על מעט דיוק כדי לשפר את זמן התגובה, והיא זו שמומלצת על ידי המפתחים למכשירי מובייל.

מה דרישות הסף להרצת המודל על כרטיס מסך בחלונות?

אתם צריכים כרטיס מסך שתומך ב־DirectX 12 עם לפחות 4 גיגה של זיכרון משותף, או מעבד גרפי של אנבידיה עם יכולת חישוב בגרסה 7.0 ומעלה במידה ואתם עובדים מול סביבת CUDA.

איך מריצים

אתם מריצים את המשקלים האלה דרך ה־API החדש של ONNX Runtime Generate בפייתון, C או C++. המאגר כולל מספר תצורות מוכנות: גרסת fp16 לכרטיסי אנבידיה, גרסאות int4 שעברו כימות בשיטת AWQ או RTN עבור כרטיסי מסך שתומכים ב־DirectML בחלונות, וגרסאות int4 מותאמות למעבדי אינטל, AMD ומובייל. מבחינת חומרה מינימלית בחלונות, צריך כרטיס שתומך ב־DirectX 12 ולפחות 4 גיגה זיכרון משותף, או כרטיס אנבידיה עם יכולת חישוב 7.0 ומעלה.

אם אתם צריכים לפרוס שירות מקומי במחשבי קצה, אפליקציית דסקטופ או מכשירי מובייל כמו גלקסי S21, הקבצים האלה נותנים לכם מענה מותאם. לעומת זאת, אם יש לכם צורך רק בקריאות API פשוטות משרת ענן מרוחק ולא אכפת לכם מחלוקת משאבים וניהול תלויות, החזקה עצמית של 16.5 גיגה של קבצים מרובים פשוט תוסיף לכם תחזוקה מיותרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3-mini-128k-instruct-onnx")
print(pipe("שלום"))

הקבצים

55 קבצים במאגר, 16.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר לכם לקחת את הקבצים, להטמיע אותם בתוך מוצרים מסחריים או פנימיים, לשנות אותם ולהפיץ אותם כרצונכם. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בתוך המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗