GPT
P

Phi-4-reasoning-plus-GGUF

קוד פתוח

unslothmit2025-05-01

  • transformers
  • gguf
  • phi3
  • text-generation
  • nlp

גרסת חשיבה מבוססת חיזוקים ל־Phi-4 של מיקרוסופט בפורמט מכווץ. היא פותרת מתמטיקה ומדע ברמה של מודלים ענקיים, אבל מייצרת חצי יותר טוקנים ומאטה תגובות.

  • 32,768טוקנים בהקשר
  • 207 GBמשקל הקבצים
  • 4,276הורדות בחודש
  • 95לייקים

מה זה

מיקרוסופט לקחה את מודל 14B שלה, הוסיפה לו אימון SFT על שרשראות חשיבה סינתטיות ואימון RL, ו־Unsloth ארזו אותו בגרסת GGUF להרצה מקומית. הפלט בנוי משני חלקים נפרדים, בלוק שרשרת חשיבה ואחריו תשובה מסכמת. המבנה הזה מאפשר לו לעקוב אחרי היגיון רב־שלבי בבעיות מורכבות במקום לנחש מיד.

במבחני מתמטיקה כמו AIME 2024 הוא מגיע ל־81.3 נקודות לעומת 69.3 ב־DeepSeek-R1-Distill-70B, וב־OmniMath הוא עומד על 81.9. התוצאות האלה מראות שמשקל קטן יחסית משיג פתרון בעיות מדויק יותר ממודלים במשקל כפול ומרובע. המחיר הישיר מופיע בזמן הריצה, מכיוון שתהליך ה־RL גורם לו לפלוט כ־50% יותר טוקנים בכל תשובה, מה שמעלה את זמני ההמתנה באופן מורגש.

מתאים ל

  • פתרון בעיות מתמטיקה ומדע

    אימון ה־RL והסריקה הרב־שלבית מביאים לדיוק גבוה בשאלות אולימפיאדה ומדע בלי צורך במודל 70B.

  • תכנון ואלגוריתמיקה מורכבת

    מתאים לבעיות לוגיות כמו 3SAT או תכנון מסלולים, בזכות יכולת מעקב אחרי שרשראות חשיבה ארוכות.

  • אימות קוד פייתון

    מוצלח לאיתור באגים אלגוריתמיים בפייתון שמחייבים הרצה יבשה והסבר לוגי לפני התיקון.

איפה זה נופל

המודל אומן ונבדק על פתרון בעיות באנגלית בלבד. עברית תניב ביצועים נמוכים מאוד ולא מומלצת כאן. בקוד, הדאטה התמקד כמעט כולו בפייתון וספריות סטנדרטיות כמו math או collections, כך שבשפות אחרות או בספריות צד שלישי יש סיכוי גבוה להזיות שדורשות בדיקה ידנית. בנוסף, מיקרוסופט מציינים שיעור שגיאות גבוה בשאלות שקשורות לבחירות, וזמני השהיה ארוכים במיוחד בגלל שרשראות חשיבה שמגיעות עד 32 אלף טוקנים.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

לא. המודל אומן ונבדק על אנגלית בלבד, וביצועיו בשפות אחרות מוגבלים מאוד. אם המוצר מיועד לטקסט בעברית, עדיף לבחור מודל רב־לשוני.

למה התשובות לא כוללות את שלבי החשיבה ב־llama.cpp?

כדי להפעיל את תגית החשיבה חובה להריץ את llama.cpp עם הדגל jinja. בלי הדגל הזה המודל מדלג על תהליך ההסקה הפנימי ועונה ישירות.

במה הדגם הזה שונה מ־Phi-4 הרגיל?

הוא עבר כוונון ייעודי לפתרון בעיות באמצעות חיזוקים ושרשראות חשיבה. הוא מדויק בהרבה במתמטיקה ולוגיקה, אך מייצר פי 1.5 יותר טוקנים ולכן עובד לאט יותר.

איך מריצים

המודל שוקל 207 גיגה־בייט במצטבר על פני 29 קבצי קוונטיזציה שונים, כך שאין צורך להוריד את הכל אלא רק את הקובץ המתאים לגודל הזיכרון שלכם. להרצה על כרטיס בודד של 16 או 24 גיגה־בייט תצטרכו גרסאות דחוסות יותר כמו Q4 או Q5. אם אתם משתמשים ב־llama.cpp, חובה להעביר את הדגל jinja, אחרת המודל יפלוט טקסט רגיל בלי לייצר את תגי החשיבה שמפעילים את היתרון שלו.

אפשר להריץ אותו גם דרך vLLM עם פרסר ייעודי לשרשראות חשיבה, או בספריות תואמות Ollama. אם יש לכם צורך בתגובות מהירות למשתמשי קצה או שאין ברשותכם חומרה ייעודית, עדיף לפנות ל־API חיצוני, כי פריסה מקומית של שרשראות חשיבה ארוכות תייצר צוואר בקבוק בחומרה חלשה.

ollama run hf.co/unsloth/Phi-4-reasoning-plus-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון MIT מלא ופתוח. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, בלי חובת שיתוף קוד ורק תחת שמירת הקרדיט וההודעה המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗