GPT
P

Phi-3-mini-128k-instruct-GGUF

קוד פתוח

QuantFactorymit2024-04-23

  • gguf
  • nlp
  • code
  • text-generation
  • en

גרסת GGUF מכווצת של המודל הקטן מבית מיקרוסופט, עם חלון של 128 אלף תווכנים. פתרון קומפקטי שמביא יכולות היסק גבוהות לחומרה מקומית מוגבלת.

  • 32.1 GBמשקל הקבצים
  • 2,861הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל שפה קומפקטי של 3.8 מיליארד פרמטרים, שמאחוריו אימון אינטנסיבי על 3.3 טריליון תווכנים הכוללים דאטה סינתטי ממוקד חשיבה ודפי רשת מסוננים. ההבדל הגדול בינו לבין מודלים אחרים במשקל נוצה הוא השילוב בין גודל פיזי קטן לחלון הקשר ענקי של 128K תווכנים, לצד כוונון של SFT ו־DPO שמחזיק אותו מיושר להוראות.

במבחני הביצועים הוא מציג מספרים יוצאי דופן לגודלו, ולעיתים עוקף מודלים של 7 ו־8 מיליארד פרמטרים. במבחן GSM-8K במתמטיקה הוא מגיע ל־83.6 נקודות, תוצאה שעוקפת אפילו את Llama 3 בגרסת 8B ואת Mixtral 8x7B. הוא חזק מאוד בהיגיון וקוד עם 57.9 ב־HumanEval ו־71.5 ב־BigBench-Hard, אם כי במבחני ידע כללי כמו TriviaQA הוא משיג רק 57.1, שזה נמוך משמעותית ממודלים גדולים יותר.

מתאים ל

  • ניתוח מסמכים ארוכים באנגלית

    חלון של 128K תווכנים מאפשר להזין דוחות עתירי מלל בבת אחת, כל עוד השפה היא אנגלית.

  • פתרון בעיות היגיון ומתמטיקה

    עם ציון של 83.6 במבחן GSM-8K, הוא מצטיין במשימות חישוב והסקה שדורשות דיוק לוגי.

  • סוכן חכם על חומרה חלשה

    משקל של 3.8B פרמטרים בגרסת GGUF מאפשר להריץ מודל חכם ישירות על מחשב נייד או מעבד מקומי.

איפה זה נופל

האימון נעשה כמעט כולו באנגלית, והכרטיס מצהיר מפורשות שביצועים בשפות אחרות יהיו נחותים משמעותית. אם תנסו לעבוד איתו בעברית, צפו להזיות, ירידה ביכולת המעקב אחרי הוראות ואיכות טקסט ירודה. מעבר לכך, נתוני המודל עודכנו לאחרונה באוקטובר 2023 ומאז הוא סטטי לגמרי.

בגזרת הקוד, רוב הדאטה מבוסס על פייתון וחבילות בסיסיות מאוד כמו typing, itertools או math. אם תבקשו ממנו לייצר סקריפטים בשפות אחרות או עם ספריות מורכבות יותר, הוא נוטה לייצר שגיאות ומחייב בדיקה ידנית של כל קריאת API.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן בעיקר על טקסטים באנגלית, והמפתחים מציינים במפורש שכל שפה אחרת תסבול מביצועים ירודים. הוא לא מיועד למשימות ניסוח, תרגום או ניתוח נתונים בעברית.

האם אפשר להשתמש בו ישירות במוצר מסחרי?

כן, רישיון MIT מתיר שימוש מסחרי מלא בלי הגבלות מיוחדות. עם זאת, הכרטיס מזהיר מפני שימוש במערכות בעלות סיכון גבוה כמו ייעוץ משפטי, רפואי או החלטות על זכאות למשאבים ללא שכבות הגנה ובדיקות עצמאיות.

איך מריצים

הקובץ מגיע בפורמט GGUF ומיועד להרצה דרך מנועים מקומיים כמו llama.cpp על מעבדים גרפיים או מעבדי CPU רגילים. המאגר כולל 16 קבצים במשקל כולל של 32.1 גיגה בייט, שמכילים רמות קוונטיזציה שונות לבחירה בהתאם למגבלות הזיכרון של המכשיר. גרסאות דחוסות של המודל הזה יכולות לרוץ בקלות על כרטיסי מסך ביתיים פשוטים או מחשבים ניידים עם זיכרון צנוע.

הבעיה העיקרית מתחילה כשרוצים לנצל את מלוא חלון ההקשר. אמנם המודל שוקל מעט, אבל שמירת זיכרון ה־KV עבור 128K תווכנים צורכת כמות אדירה של RAM או VRAM. אם אתם מתכננים להריץ פרומפטים קצרים בלבד, הרצה מקומית היא פתרון מצוין. אם אתם בונים על דחיפת ספרים שלמים פנימה ואין לכם שרת ייעודי, עדיף להשתמש ב־API מנוהל.

ollama run hf.co/QuantFactory/Phi-3-mini-128k-instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון MIT. מדובר באחד הרישיונות הפתוחים והמתירניים ביותר שיש, והוא מאפשר שימוש מסחרי ומחקרי מלא ללא תשלום תמלוגים. אתם יכולים לשלב אותו במוצר מסחרי, לשנות את הקוד ולהפיץ אותו, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗