GPT
P

phi-2-GGUF

קוד פתוח

TheBlokeother2023-12-18

  • transformers
  • gguf
  • phi-msft
  • nlp
  • code

גרסת GGUF מכווצת של המודל הקומפקטי מבית מיקרוסופט. פתרון ממוקד למי שרוצה להריץ מודל סביר ישירות על מחשב נייד או מעבד מקומי בלי לגעת בשרתים יקרים.

  • 20.2 GBמשקל הקבצים
  • 18,329הורדות בחודש
  • 233לייקים

מה זה

מדובר במודל שפיתחה מיקרוסופט עם 2.7 מיליארד פרמטרים, כשהמפתח TheBloke ארז אותו בפורמט GGUF המיועד להרצה קלה דרך פרויקטים מבוססי מעבד וכרטיסים ביתיים. האימון שלו התבסס על נתונים סינתטיים וסינון אתרים קפדני, מה שמאפשר לו להציג ביצועים שמתחרים במודלים של עד 13 מיליארד פרמטרים בהיגיון בסיסי, הבנת שפה וכתיבת קוד.

הייחוד כאן הוא הגודל מול היכולת. הוא בנוי לענות במבנה הוראות פשוט, בשיחה בסיסית, או להשלים קוד פייתון. בניגוד לכלים גדולים ומסורבלים, הוא מתרכז במשימות מוגדרות מראש ולא מנסה להיות מנוע שיחה ענקי שיודע הכול.

מתאים ל

  • השלמת קוד מקומית

    כתיבת פונקציות פייתון בסיסיות על חומרה מקומית ללא חיבור רשת.

  • ניסויי שפה על מעבד

    בדיקת שאלות ותשובות פשוטות באנגלית במחשבים עם מעט זיכרון עבודה.

  • מחקר בטיחות במודלים

    בחינת הטיות ומנגנוני שליטה על גבי ארכיטקטורה קטנה ונגישה.

איפה זה נופל

הכרטיס מדגיש שהמודל לא עבר כוונון בעזרת משוב אנושי, ולכן הוא מתקשה לעקוב אחרי הוראות מורכבות או ניואנסים, ועלול לפלוט עובדות וקוד שגויים. הידע שלו בקוד מוגבל כמעט כולו לפייתון עם חבילות סטנדרטיות כמו math או collections, ושימוש בשפות אחרות יגרור טעויות. בנוסף, הוא אומן על אנגלית בלבד, כך שסלנג ושפות אחרות, כולל עברית, יובילו לשיבושים חמורים, ואסור להכניס אותו ישירות לסביבת ייצור.

שאלות
נפוצות

האם אפשר לשלב אותו במוצר מסחרי?

לא. המודל מיועד למחקר בלבד לפי הגדרות המקור של מיקרוסופט, וסביבות ייצור אינן נתמכות. בנוסף, חוסר האימון על משוב אנושי הופך אותו ללא יציב מספיק למוצרים אמיתיים.

המודל תומך בעבודה בעברית?

לא, הנתונים אומנו על אנגלית סטנדרטית בלבד. ניסיונות לעבוד איתו בעברית יפיקו טקסט משובש, חוסר הבנה של שאלות ופליטת שגיאות רבות.

איך מריצים

אין צורך בריג מפלצתי כדי לעבוד איתו. קובץ מומלץ כמו Q4_K_M שוקל 1.79 גיגה בייט בלבד, ודורש כ־4.3 גיגה בייט זיכרון כדי לרוץ על המעבד לבד, או כרטיס מסך בסיסי אם בוחרים לפרוק אליו שכבות. הקבצים נעים מגרסת שתי סיביות במשקל 1.17 גיגה בייט עם פגיעה משמעותית בדיוק, ועד שמונה סיביות שתופסת כמעט שלושה גיגה בייט.

אפשר לטעון אותו בעזרת llama.cpp, ספריות כמו llama-cpp-python, או ממשקים כמו LM Studio ו־text-generation-webui. אם אתם צריכים רק שאילתות פשוטות בשפה האנגלית והמחשב מוגבל בחומרה, הרצה מקומית כזו משתלמת. אם יש צורך באמינות גבוהה או בהוראות מורכבות, עדיף להשתמש ב־API חיצוני של מודל גדול בהרבה.

ollama run hf.co/TheBloke/phi-2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other והמפתחים מציינים במפורש שהמודל מיועד למטרות מחקר בלבד. אסור להשתמש בו במוצרים מסחריים או בסביבות ייצור, והשימוש בו מוגבל לבדיקות בטיחות והתנסות מקומית.

הרישיון המלא בעמוד המודל ↗