GPT
Q

Qwen2.5-7B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-09-16

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסת GGUF מכווצת למודל ההוראות של עליבאבא בגודל שבעה מיליארד פרמטרים. היא נותנת לכם להריץ מודל טקסט חזק ישירות על חומרת קצה בלי לשלם על כל קריאה.

  • 113 GBמשקל הקבצים
  • 251,255הורדות בחודש
  • 75לייקים

מה זה

מדובר בהמרה מקצועית שביצע bartowski באמצעות llama.cpp עבור מודל ההוראות Qwen2.5-7B. המודל מתמקד במשימות ייצור טקסט באנגלית, ומיועד להרצה מקומית דרך LM Studio או מנועי הסקה דומים התומכים בפורמט. הייחוד של החבילה הזו הוא בכיול ה־imatrix שנעשה על בסיס נתונים ייעודי, מה שמצמצם את אובדן הדיוק שמגיע בדרך כלל עם כיווץ משקלים.

במקום לקבל קובץ יחיד וכבד, bartowski מציע כאן קשת רחבה של 27 קבצים ברמות דחיסה שונות, החל ממשקלים מלאים ועד לרמות כיווץ אגרסיביות מאוד. חלק מהגרסאות כוללות שמירה על משקלי הטמעות ופלט באיכות Q8_0, במטרה לשפר את היציבות התחבירית של המודל גם כשהגוף שלו מכווץ לחלוטין.

מתאים ל

  • עוזר מקומי למחשב נייד

    גרסת ה־Q4 נכנסת בזיכרון של מחשב נייד מודרני ומאפשרת שיחה וניסוח טקסטים באנגלית ללא תלות ברשת.

  • שרת מקומי דל תקציב

    הרץ של גרסאות ה־I-quant על כרטיסי מסך צרכניים זולים, לעיבוד אצוות של טקסטים בעלות חומרה מינימלית.

  • פיתוח על שבבי ARM

    ניצול גרסאות Q4_0_X_X הייעודיות להרצת הסקה מהירה במיוחד על שרתים או מכשירי קצה מבוססי ארכיטקטורת ARM.

איפה זה נופל

בגרסאות המכווצות ביותר, כמו אלו שיורדות מתחת ל־3 ביט, המודל מאבד מאיכותו באופן מורגש ולעיתים מייצר טעויות גסות. גרסאות מסוג I-quant אמנם חוסכות מקום אך הן איטיות יותר על מעבדים ועל שבבי אפל, ואינן נתמכות כלל ב־Vulkan של AMD. בנוסף, המודל מוגדר רשמית עבור אנגלית בלבד, כך שלא מומלץ להסתמך עליו למשימות בעברית לפני בדיקה קפדנית של התוצרים.

אותה משפחה

Qwen2.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק כדאי לי להוריד מתוך כל הרשימה?

אם יש לכם כרטיס מסך של 8 גיגה בייט ומעלה, לכו ישר על Q4_K_M או Q5_K_M. הן נותנות את היחס הטוב ביותר בין איכות פלט למהירות, ולא דורשות התעסקות עם הגדרות מיוחדות.

האם המודל ירוץ מהר על מחשבי Mac עם שבבי סיליקון?

כן, אבל כדאי לבחור בגרסאות ה־K־quants הרגילות ולא ב־I-quants, שכן אלו האחרונות נוטות לעבוד לאט יותר תחת Metal. כמו כן, הימנעו מגרסאות ה־ARM הייעודיות שמסומנות במפורש כלא מתאימות לאפל.

איך מריצים

כדי להריץ את המודל, מורידים רק קובץ GGUF ספציפי אחד ולא את כל הספרייה. המשקלים מתחילים מ־2.78 גיגה בייט בגרסאות הנמוכות ומגיעים עד 15.24 גיגה בייט עבור משקלי המקור, כאשר לרוב המשתמשים מומלץ לקחת את גרסת Q4_K_M ששוקלת 4.68 גיגה בייט. בשביל מהירות מקסימלית תצטרכו כרטיס מסך עם זיכרון פנוי שגדול בגיגה או שניים מגודל הקובץ הנבחר, למשל כרטיס של 8 גיגה בייט שיספיק מעל ומעבר לגרסת ה־4 ביט.

אם אתם על מעבדי ARM, יש חבילות מותאמות כמו Q4_0_4_4 שנותנות שיפור ביצועים, אך אינן מתאימות ל־Metal של אפל. אם אין לכם מעבד גרפי ייעודי ואתם מתכננים לרוץ על מעבד רגיל בלבד עם זמני תגובה איטיים, עדיף להשתמש ב־API חיצוני של ספק ענן במקום לחנוק את המחשב.

ollama run hf.co/bartowski/Qwen2.5-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים פנימיים או מסחריים שאתם מוכרים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗