GPT
P

Phi-3-mini-4k-instruct-onnx

קוד פתוח

microsoftmit2024-04-23

  • transformers
  • onnx
  • phi3
  • text-generation
  • ONNX

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסת שפה קומפקטית שעברה הסבה ואופטימיזציה ישירה לריצה מקומית דרך מנוע ההרצה של מיקרוסופט. מתאים למי שרוצה ביצועי הסקה גבוהים בלי להקים שרתי ענק.

  • 4,096טוקנים בהקשר
  • 16.3 GBמשקל הקבצים
  • 262הורדות בחודש
  • 148לייקים

מה זה

המאגר הזה מכיל גרסאות של המודל הקטן במשפחת פאי שלוש שעברו כיול והמרה לפורמט אונקס כדי לרוץ במהירות עם אונקס ראנטייים. האימון המקורי התבסס על שילוב של מידע סינתטי ואתרים מסוננים עם דגש על יכולות היגיון, לצד כוונון עדין ואופטימיזציית העדפות כדי לשפר מענה להוראות ובטיחות. המאגר כולל תצורות שונות, החל מגרסאות מכוילות לארבעה ביטים שמותאמות לכרטיסים של אנבידיה, אינטל ו־AMD תחת חלונות, ועד גרסאות למעבדים רגילים וטלפונים ניידים.

במבחני הביצועים של מיקרוסופט, המנוע מציג יתרון מהירות משמעותי מול פייטארץ'. למשל, בהרצה על כרטיס A100 בתצורת ארבעה ביטים עם פרומפט קצר, אונקס הגיע לקצב של 218 טוקנים בשנייה לעומת כעשרים בלבד בפייטארץ'. מצד שני, מול מנועים מקומיים כמו לאמה סי פי פי היתרון משתנה לפי העומס, וכשמריצים פרומפטים ארוכים של אלפיים טוקנים על המעבד, לאמה סי פי פי דווקא הציג יתרון קל עם תשעה טוקנים בשנייה לעומת שבעה וחצי באונקס.

מתאים ל

  • עוזר מקומי למחשבי קצה

    ריצה מקומית על כרטיסי מסך מודרניים בחלונות תוך ניצול תאימות DirectML.

  • הסקה מהירה באפליקציות שרת

    קבלת קצבי תגובה גבוהים במיוחד בכרטיסי אנבידיה בזכות כיול לארבעה ביטים.

  • עיבוד טקסט במכשירים ניידים

    הרצה מקומית על גבי מעבדי טלפונים תומכים באמצעות גרסאות מכוילות וקלות.

איפה זה נופל

חלון ההקשר במודל הזה מוגבל לארבעת אלפים טוקנים בלבד, כך שהוא לא מתאים למסמכים ארוכים, ספרים או קוד מורכב מדי. בנוסף, על מעבדים רגילים קצב היצירה נע בין שבעה לחמישה עשר טוקנים בשנייה בלבד, מה שמורגש היטב בזמן אמת. תצטרכו לבדוק בעצמכם את איכות הפלט בעברית, מאחר שהתיעוד מתמקד בביצועי חומרה בלבד ולא מציין יכולות רב־לשוניות.

אותה משפחה

Phi-3-mini יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסה כדאי לבחור מתוך הקבצים שבמאגר?

זה תלוי בחומרה שעליה המערכת תרוץ בפועל. לחלונות עם כרטיסי מסך שונים בחרו בגרסת DirectML int4, לשרתים עם אנבידיה עדיף להשתמש בגרסאות ה־CUDA, ולמכשירים ניידים מומלץ לקחת את גרסת המעבד ברמת דיוק ארבע לביצועים מרביים.

האם המודל ירוץ בצורה סבירה על מחשב בלי כרטיס מסך חזק?

הוא ירוץ באמצעות גרסת המעבד, אך מהירות הפלט תהיה נמוכה משמעותית. בבדיקות של מיקרוסופט המעבד הפיק סביב עשרה עד חמישה עשר טוקנים בשנייה, קצב שיכול להספיק למשימות רקע שאינן דורשות תגובה מיידית למשתמש.

איך מריצים

הרצת המודל מתבצעת דרך הממשק היעודי של אונקס ראנטייים בפייתון, סי או סי פלוס פלוס, תוך שימוש בחבילות ההרצה המתאימות לחומרה שלכם. תחת חלונות נדרש כרטיס מסך שתומך בדירקט אקס 12 ולפחות ארבעה ג'יגה בייט זיכרון משותף. למאיצי אנבידיה דרוש כרטיס עם יכולת חישוב 7.0 ומעלה, כשהבדיקות של החברה נעשו בין היתר על כרטיס RTX 4090 ומעבד אינטל Core i9.

אם אתם רצים על מעבדים רגילים או מכשירי מובייל כמו גלקסי אס 21, יש גרסת ארבעה ביטים עם דרגות דיוק שונות, כאשר רמה אחת מתעדפת דיוק ורמה ארבע ביצועים. אם אין לכם חומרה פיזית תואמת ואתם צריכים לטפל בפניות מקביליות רבות מקוראים שונים, שרת ענן ייעודי יחסוך את כאב הראש של ניהול הזיכרון המקומי.

from transformers import pipeline

pipe = pipeline("text-generation", model="microsoft/Phi-3-mini-4k-instruct-onnx")
print(pipe("שלום"))

הקבצים

56 קבצים במאגר, 16.3 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים בלי תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗