GPT
P

Phi-4-mini-instruct-GGUF

קוד פתוח

unslothmit2025-02-28

  • transformers
  • gguf
  • phi3
  • text-generation
  • phi

גרסת GGUF מתוקנת למודל קומפקטי של 3.8 מיליארד פרמטרים עם חלון הקשר ענק, שנועדה לריצה מקומית חסכונית במשאבים עם דגש על היגיון ומתמטיקה.

  • 131,072טוקנים בהקשר
  • 24.0 GBמשקל הקבצים
  • 102,347הורדות בחודש
  • 143לייקים

מה זה

מדובר במודל שפה קומפקטי עם 3.8 מיליארד פרמטרים וחלון הקשר של 131,072 טוקנים, שמתמחה בהסקה לוגית ובפתרון בעיות מתמטיות למרות מידותיו הצנועות. unsloth לקחו את המודל המקורי של מיקרוסופט ותיקנו בו באגים ספציפיים שהיו בטוקניזציה ובטמפלייט השיחה, כמו בלבול בין טוקן הריפוד לטוקן הסיום וסיום מוקדם מדי של פלט.

במבחני ביצועים הוא עוקף מודלים מקבילים בגודל שלו ואפילו כפולים ממנו במשימות חשיבה. בציון BigBench Hard הוא הגיע ל־70.4 ובמבחן MATH ל־64.0, שזה פער ניכר מול מתחרים באותו משקל. הפשרות מגיעות בידע כללי ובעובדות יבשות, תחום שבו מודל קטן פשוט לא מכיל מספיק זיכרון.

מתאים ל

  • פתרון בעיות מתמטיקה

    מציג ציון של 64.0 במבחן MATH, תוצאה גבוהה בהרבה מרוב המודלים בנפח של פחות מ־4 מיליארד פרמטרים.

  • הפעלת פונקציות וכלים

    כולל תמיכה מובנית בטוקנים ייעודיים לתחביר JSON עבור Function Calling במערכות אוטומציה.

  • ניתוח מסמכים מקומי ב־RAG

    הקשר של 131,072 טוקנים מאפשר לעבד טקסטים ארוכים במחשב מקומי, בתנאי שהמידע העובדתי מוזרק מבחוץ.

איפה זה נופל

הבעיה המרכזית היא חוסר בידע עובדתי רחב והזיות, תופעה טבעית במודלים של פחות מארבעה מיליארד פרמטרים. בלי חיבור למערכת חיפוש או RAG, לא כדאי להסתמך עליו כמאגר מידע.

בנוסף, הכרטיס מזהיר מביצועים חלשים יותר בשפות שאינן אנגלית, מה שרלוונטי מאוד בעברית שאינה שפת הליבה שלו. איכות הקוד שלו מתמקדת בעיקר בספריות פייתון סטנדרטיות, ובשיחות ארוכות במיוחד הוא נוטה לחזרתיות ולאיבוד עקביות.

שאלות
נפוצות

למה להוריד את הגרסה של unsloth ולא את המקור של מיקרוסופט?

בגרסה המקורית היו באגים מציקים בטמפלייט השיחה ובטוקן הסיום שגרמו לפלט להיקטע באמצע או להציג תווים שגויים. unsloth סידרו את הגדרות הטוקנייזר כך שהמודל עוצר בדיוק איפה שצריך.

איך המודל מתמודד עם עברית?

הוא מוגדר כרב לשוני ומכיל מילון מורחב של 200 אלף טוקנים, אך הכרטיס מציין מפורשות שעיקר האימון נעשה באנגלית. ביצועים בשפות אחרות נמוכים יותר ויש לבדוק את איכות הפלט בעברית לפני שמסתמכים עליו.

איך מריצים

המודל שוקל 24.0 ג'יגה בייט בגרסתו המלאה המחולקת ל־11 קבצים, אבל בפורמט GGUF מריצים אותו דרך ספריות מקומיות בכימותים שדורשים הרבה פחות זיכרון. לשימוש מקומי אפשר להסתפק במעבד גרפי עם 8 עד 16 ג'יגה זיכרון וידאו, תלוי ברמת הכימות שבוחרים ובאורך ההקשר בפועל.

אם אתם צריכים להריץ חלונות הקשר שמגרדים את הרף של 128 אלף טוקנים באופן קבוע, דרישות הזיכרון לניהול ההקשר יקפצו משמעותית. במצב כזה, או אם אין לכם חומרה ייעודית זמינה, קריאה לשרת ענן או ל־API מנוהל תהיה פשוטה וזולה יותר מתחזוקת שרת עצמאי.

ollama run hf.co/unsloth/Phi-4-mini-instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות היא חופש פעולה מלא, כולל שימוש מסחרי, שינוי הקוד, הפצה והטמעה במוצרים סגורים, בלי תמלוגים או חובת פתיחת קוד. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקבצי התוכנה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗