GPT
P

phi-4-gguf

קוד פתוח

microsoftmit2025-01-08

  • transformers
  • gguf
  • phi
  • nlp
  • math

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

גרסת קבצי המשקולות המכווצים למודל של מיקרוסופט נותנת ביצועי חשיבה ומתמטיקה חריגים לגודל של 14 מיליארד פרמטרים, במיוחד למי שמחפש להריץ מקומית בלי לזלול שרתים שלמים.

  • 197 GBמשקל הקבצים
  • 7,849הורדות בחודש
  • 201לייקים

מה זה

מיקרוסופט אימנה את הדגם הזה על כמעט עשרה טריליון טוקנים, תוך דגש כבד על חומרי לימוד סינתטיים, מתמטיקה, קוד וספרים אקדמיים. המבנה הוא מודל פענוח של 14 מיליארד פרמטרים עם חלון הקשר של 16 אלף טוקנים. הנתונים מראים שההתמקדות הזו עבדה בדיוק איפה שכיוונו אליו.

במבחני מדע קשים כמו GPQA הוא עוקף אפילו דגמים עצומים כמו לאמה 70B, ובמבחן MATH הוא מגיע לתוצאה של 80.4 שמשתווה למודלים מובילים בתעשייה. מנגד, הוא לא נבנה כמאגר ידע כללי. במבחן העובדות SimpleQA הוא קיבל ציון נמוך של 3 נקודות בלבד, מה שאומר שהוא מצטיין בלפתור בעיות מורכבות אבל חלש מאוד בשליפת עובדות יבשות מהזיכרון.

מתאים ל

  • פתרון בעיות מתמטיקה

    התוצאות במבחן MATH עוקפות דגמים גדולים בהרבה, מה שהופך אותו לבסיס חזק לחישובים והסברים.

  • ניתוח לוגיקה בהקשר סגור

    הוא מבריק בחשיבה מורכבת מתוך טקסט שמספקים לו ישירות בתוך חלון של 16 אלף טוקנים.

  • אוטומציה של סקריפטים בפייתון

    רוב נתוני הקוד שלו התמקדו בספריות הליבה של פייתון והוא עוקב אחרי הוראות בפורמט צ'אט בצורה מדויקת.

איפה זה נופל

המודל הזה מכוון לאנגלית בלבד, ורק כשמונה אחוזים מנתוני האימון שלו כללו שפות אחרות, כך שלעברית הוא אינו מתאים כלל. בנוסף, הוא כמעט חסר תועלת כשאלון עובדתי ומייצר הזיות בקלות אם שואלים אותו על עובדות יבשות בלי להזין לו את המידע מראש בהקשר. בקוד, הוא מוגבל כמעט רק לפייתון ולספריות הבסיסיות שלו, וכל שימוש בספריות מורכבות יותר או בשפות תכנות אחרות דורש בדיקה ידנית זהירה.

אותה משפחה

phi-4 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

לא מומלץ לבנות עליו בעברית. המפתחים מציינים במפורש שהוא מאומן בעיקר באנגלית ושפות אחרות כמעט לא יוצגו באימון ויסבלו מביצועים ירודים.

האם צריך להוריד את כל 197 הגיגה בייט כדי להריץ אותו?

ממש לא. מדובר באוסף של 29 קבצי קוונטיזציה שונים, ואתם צריכים להוריד רק קובץ אחד שמתאים לכמות הזיכרון שיש לכם בחומרה.

האם אפשר להשתמש בו כעוזר למענה על שאלות כלליות?

רק אם מחברים אותו למערכת ששולפת את המידע עבורו. המודל השיג תוצאה נמוכה במיוחד במבחן ידע עובדתי, ולכן ימציא פרטים בקלות על עובדות היסטוריות או כלליות שלא הוזנו בפרומפט.

איך מריצים

הריצה מתבצעת ישירות דרך כלי כמו llama.cpp עם תמיכה בהרצה מקומית על מעבד וכרטיס מסך. המאגר כולל 29 קבצים בנפח כולל של 197 גיגה בייט שמכילים רמות שונות של קוונטיזציה, כך שלא מורידים את כל הנפח אלא בוחרים קובץ יחיד, למשל גרסת 4 ביט.

לגרסת 4 ביט נדרש כרטיס מסך מודרני עם לפחות 10 עד 12 גיגה בייט של זיכרון כדי לעבוד בנוחות עם ההקשר המלא. אם אין לכם חומרה ייעודית מקומית או שאתם צריכים רק קריאות פשוטות בלי לתחזק שרת, עדיף להשתמש בנקודת קצה מנוהלת בענן במקום להסתבך עם קבצים והקצאת זיכרון מקומי.

ollama run hf.co/microsoft/phi-4-gguf:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון כאן הוא MIT רגיל ומתירני לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים של מיקרוסופט בתוך הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗