GPT
P

Phi-3-medium-128k-instruct-GGUF

קוד פתוח

bartowskimit2024-05-21

  • gguf
  • nlp
  • code
  • text-generation
  • multilingual

גרסה מכווצת של המודל הבינוני מבית מיקרוסופט, עם תמיכה בהקשר ארוך במיוחד. מתאים למי שרוצה להריץ לוקאלית ניתוח מסמכים ארוכים בלי שרתים מנופחים.

  • 284 GBמשקל הקבצים
  • 4,458הורדות בחודש
  • 61לייקים

מה זה

מדובר בהמרה לקובצי GGUF של המודל המקורי מבית מיקרוסופט, שבוצעה על ידי bartowski בעזרת llama.cpp וכיול imatrix. המודל שייך לקטגוריית גודל בינוני, תומך במספר שפות ומיועד למשימות של יצירת טקסט ומעקב אחר הוראות. היתרון הבולט בגרסה זו הוא חלון הקשר נרחב של 128 אלף טוקנים, המאפשר להזין טקסטים ארוכים, קוד ומסמכים מורכבים בבת אחת.

היוצר שחרר מגוון רחב של שיטות כיבוץ, החל ממשקלים מלאים בפורמט f32 בנפח של מעל 55 ג'יגה בייט ועד לקבצים מכווצים מאוד בגודל של פחות מארבעה ג'יגה בייט בשיטות IQ2. הגרסאות המומלצות לרוב המשתמשים מאזנות בין גודל של שמונה עד עשרה ג'יגה בייט לבין שמירה על יכולות ההסקה של המודל המקורי.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון של 128 אלף טוקנים מאפשר להזין קובצי טקסט שלמים, חוזים או תיעוד טכני ישירות לזיכרון המודל.

  • עבודה לוקאלית על לפטופ

    משקלי כיבוץ סביב 8 ג'יגה מתאימים לחומרה שולחנית ומאפשרים לשמור על פרטיות המידע ללא שליחה לשרת חיצוני.

  • בוט פקודות והוראות

    המודל אומן מראש במבנה של הנחיות ומענה לשאלות, מה שמקל על שילובו במערכות סקריפטים ואוטומציה.

איפה זה נופל

הגרסאות המכווצות ביותר כמו Q2 או IQ2_XXS שוקלות פחות מארבעה ג'יגה בייט אך מוגדרות מראש כבעלות איכות נמוכה מאוד, כך שהן עלולות לפלוט שטויות במשימות עדינות. מעבר לכך, הכרטיס מדגיש ששיטות מסוג IQ אינן נתמכות תחת Vulcan אצל משתמשי AMD, ועלולות לרוץ לאט יותר על מעבדים או על מחשבי מק עם Apple Metal בהשוואה לגרסאות K מקבילות.

אותה משפחה

Phi-3-medium יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי מומלץ להוריד מתוך כל האפשרויות?

קובץ Q4_K_M במשקל 8.57 ג'יגה בייט הוא הבחירה המאוזנת ביותר לרוב המשתמשים. אם יש לכם מספיק מקום וכרטיס מסך חזק, גרסאות Q5_K_M או Q6_K יספקו איכות גבוהה יותר.

איך אפשר להוריד קובץ בודד בלי למשוך את כל התיקייה?

משתמשים בכלי השורת פקודה huggingface-cli ומגדירים בפרמטר include רק את שם הקובץ הספציפי שרוצים, למשל גרסת ה־Q4, מה שחוסך הורדה של עשרות ג'יגה בייטים מיותרים.

איך מריצים

כדי להריץ אותו במהירות מרבית, צריך כרטיס מסך עם מספיק זיכרון וידאו שיכיל את הקובץ כולו, ועוד גיגה או שניים פנויים. גרסת Q4_K_M שוקלת 8.57 ג'יגה בייט ומתאימה לרוב השימושים על כרטיס עם 12 ג'יגה זיכרון. אם אין לכם מעבד גרפי מתאים, אפשר לטעון אותו לזיכרון הראשי של המחשב ולהריץ על המעבד, אך מהירות התגובה תרד.

אפשר להריץ את הקבצים ישירות בתוכנת LM Studio או דרך llama.cpp, תוך שמירה על מבנה הפרומפט המוגדר של משתמש ועוזר. אם אתם זקוקים לכיבוץ נמוך מ־Q4, עדיף להשתמש בגרסאות ה־IQ אם החומרה שלכם תומכת ב־cuBLAS או rocBLAS, אחרת כדאי לדבוק בגרסאות ה־K הרגילות.

ollama run hf.co/bartowski/Phi-3-medium-128k-instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

34 קבצים במאגר, 284 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. מדובר ברישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי הקוד והפצה חופשית לכל מטרה, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗