GPT
P

Phi-3.5-mini-instruct-GGUF

קוד פתוח

bartowskimit2024-08-20

  • transformers
  • gguf
  • nlp
  • code
  • text-generation

גרסת GGUF מכווצת של המודל הקטן מבית מיקרוסופט, שמיועדת להרצה מקומית מהירה וחסכונית במשאבים על מחשבים אישיים או מעבדי ARM בלי לשלם על שירותי ענן.

  • 62.8 GBמשקל הקבצים
  • 51,845הורדות בחודש
  • 91לייקים

מה זה

מדובר בהמרה של הדגם המקורי של מיקרוסופט לפורמט GGUF בעזרת llama.cpp, כשהיא כוללת כיול מבוסס imatrix לשמירה על חדות המענה גם ברמות כיווץ אגרסיביות. המודל מתמקד במשימות טקסט ושיחה, ומציע חלופה מעשית למי שרוצה להריץ מודל הוראות שלם ישירות על המכשיר שלו בלי לגעת בשרתים מרוחקים.

היתרון המרכזי כאן הוא הגמישות בחומרה. במקום קובץ ענק של 15.29 ג'יגה בייט בפורמט המקורי, מקבלים מבחר רחב של רמות דיוק שמתחילות בגרסאות זעירות של 1.32 ג'יגה בייט בלבד. המשמעות היא יכולת לקבל ביצועי שיחה והבנה סבירים לגמרי על חומרה יומיומית, כשיש אפילו גרסאות ייעודיות שמנצלות פקודות עיבוד ייחודיות של שבבי ARM.

היוצר Bartowski שילב במאגר הזה גם ניסוי מעניין שבו שכבות הפלט וההטמעה נשמרות ברמת שמונה ביט בעוד שאר המשקולות מכווצות יותר. זה נותן מענה מדויק יותר לתחום המשקלים הנמוך, למי שמנסה לסחוט איכות טובה מתקציב זיכרון לחוץ במיוחד.

מתאים ל

  • עוזר מקומי בתוך תוכנה

    משקל קל של 2.4 ג'יגה בייט מאפשר לארוז אותו ישירות במחשב של המשתמש בלי תלות ברשת.

  • עיבוד טקסט על חומרת ARM

    גרסאות Q4_0 ייעודיות סוחטות ביצועים ומהירות גבוהה על מעבדי מובייל ומחשבים ניידים.

  • מערכת בדיקות מקומית

    מאפשר לפתח סביבות שיחה ושאילתות במחשב פיתוח מנותק מענן בעזרת LM Studio בקלות.

איפה זה נופל

הגרסאות המכווצות ביותר, כמו אלו מתחת לשני ג'יגה בייט, מאבדות דיוק במהירות ומייצרות טעויות עובדתיות או תשובות מבולבלות. מעבר לזה, גרסאות ה־I-quants החדשות אמנם משפרות ביצועים מול משקל, אבל הן איטיות יותר בעיבוד מעבד ואינן נתמכות בכלל בסביבות מבוססות Vulkan על כרטיסי AMD. אם אתם בונים על עברית תקינה לחלוטין, חובה לבדוק את הפלט מראש כי מודלים קטנים נוטים להישבר בתחביר מקומי מורכב.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה הענקית?

הקובץ המומלץ לרוב האנשים הוא Q4_K_M ששוקל 2.39 ג'יגה בייט. הוא מציע פשרה מצוינת בין שמירה על דיוק השפה לבין דרישות זיכרון שמתאימות כמעט לכל מחשב מודרני. אם יש לכם זיכרון גרפי פנוי בשפע, אפשר לעלות לגרסת Q6_K לקבלת איכות קרובה למקור.

האם גרסאות ה־ARM מתאימות למחשבי מק עם שבבי אפל?

לא. יוצר המודל מציין במפורש שגרסאות Q4_0_X_X אינן מיועדות למערכת Metal של אפל, אלא למעבדי ARM רגילים. למחשבי מק עדיף לבחור בגרסאות K הרגילות כמו Q4_K_M או Q5_K_M, שירוצו ישירות ובצורה חלקה על המעבד הגרפי.

איך מריצים

טוענים קובץ בודד לתוך LM Studio או מריצים דרך llama.cpp, בלי צורך להוריד את כל המאגר. עבור רוב המחשבים עם מעבד גרפי של שישה או שמונה ג'יגה זיכרון, גרסת Q4_K_M במשקל 2.39 ג'יגה בייט היא נקודת הפתיחה המאוזנת ביותר, ונכנסת כולה לזיכרון הגרפי בלי לזלוג לזיכרון הכללי.

אם אתם על מעבדי ARM, גרסאות Q4_0_4_4 ודומותיהן מציעות קצב עיבוד גבוה יותר במעבד הראשי בזכות התאמה ספציפית לסט ההוראות של השבב. עם זאת, אם אתם מפתחים מוצר שמשרת אלפי בקשות במקביל וזקוק לביצועים חזקים בהרבה או לתמיכה בעברית מורכבת, הפעלת מודל כזה מקומית עשויה לחנוק את המעבד, ועדיף לקרוא למודלים ענקיים דרך API מסחרי.

ollama run hf.co/bartowski/Phi-3.5-mini-instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקבצים והפצה מחדש בתוך מוצרים סגורים. התנאי היחיד הוא השארת הודעת זכויות היוצרים המקורית של היוצר בתוך הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗