GPT
P

Phi-3-mini-4k-instruct-gguf

קוד פתוח

microsoftmit2024-04-22

  • gguf
  • nlp
  • code
  • text-generation
  • en

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסת GGUF מכווצת למודל קומפקטי במיוחד, שמיועד לריצה מקומית ומציג יכולות היגיון וקוד מפתיעות ביחס למשקל של פחות מארבעה מיליארד פרמטרים.

  • 9.3 GBמשקל הקבצים
  • 24,060הורדות בחודש
  • 602לייקים

מה זה

מיקרוסופט אימנה פה מודל של 3.8 מיליארד פרמטרים על 3.3 טריליון טוקנים, תוך סינון אגרסיבי של נתונים מהרשת והוספת המון דאטה סינתטי שממוקד במתמטיקה ולוגיקה. הוא עבר כוונון עדין ואופטימיזציית העדפות ישירה (DPO), מה שמחזיק אותו צמוד להוראות בפורמט צ'אט מוגדר. לפי היצרן, במבחני שפה, קוד והיגיון הוא עוקף מתחרים של עד 13 מיליארד פרמטרים, כלומר מקבלים ביצועים של מודל כבד בהרבה בלי לשלם על הזיכרון שלו.

המשמעות של גרסת ה־GGUF הזו היא שכל העסק נדחס לקבצים שרצים ישירות על מעבד ביתי או כרטיס גרפי צנוע, בלי תלות בתשתיות ענן מורכבות. חלון ההקשר כאן עומד על 4K טוקנים, מה שמתאים לשאלות ותשובות, פקודות ישירות ועיבוד מקטעי טקסט קצרים יחסית.

מתאים ל

  • עוזר מקומי למחשב נייד

    קובץ ה־q4 שוקל 2.2 גיגה ורץ חלק מקומית דרך Ollama בלי שום צורך בכרטיס מסך ייעודי.

  • סקריפטים בסיסיים בפייתון

    המודל אומן ספציפית על חבילות ליבה בפייתון ומצטיין במשימות לוגיקה ואוטומציה פשוטות באנגלית.

  • סיווג טקסטים קצרים באנגלית

    זמן תגובה מהיר במיוחד וחלון של 4,096 טוקנים שאידיאלי לתיוג מיילים ושאלות נפוצות.

איפה זה נופל

האימון נעשה כמעט לחלוטין באנגלית, ודפי המודל מזהירים במפורש שכל שפה אחרת תסבול מירידה חדה באיכות. לכן לא הייתי בונה עליו לעיבוד טקסטים בעברית. בנוסף, הוא אומן על נתונים שנקטעו באוקטובר 2023, ומייצר הזיות עובדתיות בביטחון מלא אם מבקשים מידע עדכני.

בגזרת הקוד, רוב הדאטה מבוסס על פייתון עם חבילות ליבה בסיסיות כמו math ו־datetime. ברגע שמבקשים ממנו ספריות מורכבות יותר או שפות תכנות אחרות, הוא נוטה להמציא קריאות לפונקציות שלא קיימות וחובה לבדוק כל שורת קוד שהוא פולט.

אותה משפחה

Phi-3-mini יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יבין שאלות ויחזיר תשובות בעברית?

התיעוד מציין בפירוש שהמודל אומן בעיקר על אנגלית ואיכות הביצועים בכל שפה אחרת נמוכה בהרבה. לא מומלץ להסתמך עליו לפרויקטים בעברית ללא כוונון נוסף.

איזה קובץ עדיף להוריד מתוך התיקייה?

לרוב השימושים מומלץ לקחת את Phi-3-mini-4k-instruct-q4.gguf. הוא שוקל 2.2 גיגה־בייט ומספק איזון מעולה בין מהירות לאיכות. קובץ ה־fp16 שוקל 7.2 גיגה ומתאים רק למי שחייב אפס איבוד דיוק ויש לו חומרה חזקה.

איך מריצים

יש פה שתי אפשרויות עיקריות. קובץ ה־q4 שוקל 2.2 גיגה־בייט ומיועד למערכות מוגבלות במשאבים, כשהוא נכנס בקלות בזיכרון של מחשב נייד ממוצע ורץ מעולה דרך Ollama או Llamafile בלי התעסקות. אם הדיוק קריטי, קובץ ה־fp16 תופס 7.2 גיגה־בייט ודורש כרטיס גרפי סביר עם לפחות 8 גיגה־בייט זיכרון כדי לעבוד במהירות טובה.

אפשר לטעון אותו גם ישירות בפייתון עם llama-cpp-python ולשלוט במספר השכבות שעוברות לכרטיס המסך (עד 35 שכבות). אם המטרה היא לעבד מאסות של מסמכים ארוכים מעבר ל־4K טוקנים, אין טעם להריץ את הגרסה הזו לבד ועדיף להשתמש ב־API של גרסת ה־128K.

ollama run hf.co/microsoft/Phi-3-mini-4k-instruct-gguf:Q4

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר ברישיון MIT מלא. אפשר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו בתוך מוצרים סגורים, בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים המקורית של מיקרוסופט ולא להשתמש בסימני המסחר שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗