GPT
P

Phi-3-medium-4k-instruct-GGUF

קוד פתוח

bartowskimit2024-05-21

  • gguf
  • nlp
  • code
  • text-generation
  • multilingual

גרסת GGUF מכווצת למודל ההוראות הבינוני של מיקרוסופט, מותאמת להרצה מקומית על כרטיסי מסך ביתיים ומחשבים אישיים בלי לשלם על שרתי ענן.

  • 197 GBמשקל הקבצים
  • 5,444הורדות בחודש
  • 39לייקים

מה זה

המאגר הזה מציע המרות שונות של המודל המקורי מבית מיקרוסופט באמצעות llama.cpp, כשהמטרה היא לאפשר הרצה מקומית בכלים כמו LM Studio. הדגש כאן הוא על שימוש בכיול imatrix, מה שמשפר את הדיוק של המשקלים אחרי כיווץ בהשוואה להמרות ישירות רגילות.

במקום לקחת את המודל הגולמי ולשבור את הראש עם תצורות כבדות, bartowski ארז אותו בעשרות רמות דחיסה. יש כאן גרסאות ששומרות על שכבות הפלט וההטמעה ברמת דיוק גבוהה של Q8_0 כדי למנוע הידרדרות באיכות התשובות, לצד גרסאות IQ מתקדמות שסוחטות עוד ביצועים כשיורדים ברמת הדחיסה.

מתאים ל

  • עוזר מקומי למחשב אישי

    גרסת Q4_K_M רצה על כרטיסי מסך ביתיים ללא תלות ברשת ותוך שמירה על פרטיות מלאה.

  • מענה טכני למשימות קצרות

    ביצוע פקודות וניתוח טקסט ממוקד שנכנס בגבולות 4k טוקנים של הקשר המודל.

  • הרצה על חומרה מוגבלת

    גרסאות ה־IQ הנמוכות מאפשרות הפעלה על זיכרון מערכת צנוע בשימוש בכרטיסים תואמים.

איפה זה נופל

חלון ההקשר מוגבל למדי ועומד על 4k בלבד לפי שם המודל, כך שהוא לא מתאים לניתוח מסמכים ארוכים או שיחות מתמשכות בלי איבוד מידע. בנוסף, רמות הכיווץ הנמוכות ביותר כמו Q2 או Q3_K_S מאבדות דיוק בצורה מורגשת, ולא הייתי סומך עליהן לקוד או למשימות שדורשות הבנה לוגית מדויקת. צריך גם לזכור שמימוש ה־IQ דורש התאמה של מנוע ההרצה ולא נתמך בכל תצורה גרפית.

אותה משפחה

Phi-3-medium יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 24 הקבצים שמופיעים במאגר?

ממש לא. מורידים רק קובץ GGUF יחיד לפי נפח הזיכרון הפנוי שלכם בכרטיס המסך או במחשב, אלא אם כן בחרתם בגרסת f32 המפוצלת שדורשת איחוד קבצים.

מה ההבדל בין גרסאות K לגרסאות IQ?

גרסאות K הן התקן המוכר והבטוח ב־llama.cpp, בעוד שגרסאות IQ משתמשות באלגוריתם חדש שנותן איכות טובה יותר בנפחים קטנים, אך הן אינן נתמכות בתשתית הגרפית של Vulkan.

איך מריצים

בוחרים קובץ בודד לפי כמות הזיכרון שיש לכם. כדי לקבל ביצועים מהירים כדאי לבחור קובץ ששוקל ג'יגה או שניים פחות מנפח הזיכרון של כרטיס המסך, כמו Q4_K_M ששוקל 8.57GB ומתאים לכרטיס עם 10GB או 12GB.

מורידים רק קובץ אחד ישירות באמצעות huggingface-cli או פותחים אותו בתוכנת LM Studio. אם יש לכם מחשב ישן וצריך לרדת מתחת לגרסאות 4 ביט, גרסאות ה־IQ החדשות נותנות פתרון טוב על מעבדי Nvidia או AMD, אבל שימו לב שהן לא עובדות עם Vulkan.

ollama run hf.co/bartowski/Phi-3-medium-4k-instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש חופשי לגמרי, כולל שימוש מסחרי, שינוי הקוד והפצה מחדש במוצרים סגורים, בלי דרישה לתמלוגים ובתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗