GPT
P

Phi-3-mini-128k-instruct-GGUF-Imatrix-smashed

קוד פתוח

PrunaAIרישיון לא דווח2024-04-23

  • pruna-ai
  • gguf
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של מודל ההוראות הקטן של מיקרוסופט עם הקשר רחב. היא מתאימה למי שרוצה להריץ מודל טקסט מקומית על מעבד או כרטיס מסך ביתי בלי לחנוק את הזיכרון.

  • 55.4 GBמשקל הקבצים
  • 8,669הורדות בחודש
  • 68לייקים

מה זה

מדובר באריזה מכווצת של המודל של מיקרוסופט באמצעות טכניקת Imatrix על בסיס טקסטים מוויקיפדיה, שנשמרה בפורמט GGUF להרצה מקומית קלה. המטרה כאן היא לקחת מודל שמיועד לעיבוד שיחות וטקסט ארוך, ולחתוך לו את המשקל בלי לרסק לגמרי את איכות התוצאה.

המאגר כולל אוסף רחב של רמות כימות, החל מגרסאות מדויקות יחסית כמו Q5 ו־Q4 ועד לרמות דחיסה אגרסיביות כמו Q2 או IQ3. המפרסמים מציינים שכימות ברמות הנמוכות פוגע באיכות הפלט לעומת מקור, כך שהבחירה פה היא תמיד פשרה ישירה בין צריכת משאבים לדיוק הטקסט.

מתאים ל

  • הרצה מקומית במחשב נייד

    קובץ בודד בכימות Q4 מאפשר להריץ מודל שיחה זריז ישירות על חומרה ביתית בלי שרתים יקרים.

  • קריאת מסמכים ארוכים

    המודל מיועד להקשר נרחב, ומאפשר להזין טקסטים גדולים בתוך llama.cpp בלי לחתוך קטעים.

  • סביבות פיתוח מנותקות רשת

    מאפשר לשלב מודל הוראות בקוד פייתון מקומי דרך llama-cpp-python בלי להוציא נתונים החוצה.

איפה זה נופל

היוצרים מציינים במפורש שאיכות התשובות עשויה לרדת לעומת המודל המקורי בגלל הדחיסה, ובגרסאות הנמוכות זה מורגש היטב. בנוסף, כיול הנתונים בוצע על WikiText באנגלית, כך שאין כאן אופטימיזציה ייעודית לעברית ומומלץ לבדוק היטב את איכות הפלט וההיגיון של התשובות לפני שבונים עליו משהו אמיתי.

שאלות
נפוצות

האם צריך להוריד את כל 55 הגיגה שמופיעים במאגר?

ממש לא, המאגר מכיל עשרות גרסאות שונות של אותו מודל ברמות כיווץ משתנות. אתם בוחרים ומורידים רק קובץ GGUF אחד שמתאים לזיכרון שיש לכם במחשב.

איזו גרסה מומלץ לבחור מהרשימה?

לפי כרטיס המודל, גרסאות Q5_K_M או Q4_K_M נותנות איכות טובה ויציבה. אם הזיכרון ממש לחוץ אפשר לבדוק את IQ4_NL, אבל מומלץ להתרחק מ־Q3_K_S שהוגדר כלא מומלץ.

איך מריצים

אתם לא מורידים את כל התיקייה ששוקלת 55.4 גיגה, אלא בוחרים קובץ בודד לפי כמות הזיכרון שיש לכם. ההרצה נעשית ישירות דרך llama.cpp, ממשקים כמו LM Studio או קוד פייתון עם llama-cpp-python, כאשר מעבירים את השכבות לכרטיס המסך כדי לקבל מהירות סבירה.

גרסאות כמו Q4_K_M או IQ4_NL מציעות איזון שפוי ומחזיקות באיכות טובה, בעוד רמות כמו Q3_K_S לא מומלצות על ידי היוצרים. אם השרת שלכם חלש מדי כדי להחזיק הקשר של עשרות אלפי תווים בלי לקרוס בזיכרון, עדיף להשתמש בנקודת קצה מנוהלת.

ollama run hf.co/PrunaAI/Phi-3-mini-128k-instruct-GGUF-Imatrix-smashed:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד של המאגר הזה. היוצרים כותבים שהרישיון נשען על תנאי המודל המקורי של מיקרוסופט ודורשים לבדוק אותו שם באופן עצמאי. כל עוד לא בדקתם את הרישיון המקורי, אתם לוקחים סיכון משפטי בהפצה או בשימוש מסחרי ישיר במוצר שלכם.

הרישיון המלא בעמוד המודל ↗