GPT
Q

bartowski/Qwen2.5-7B-Instruct-1M-GGUF

קוד פתוח

bartowskiapache-2.02025-01-25

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

גרסה מכווצת של מודל שבעה מיליארד פרמטרים עם תמיכה בהקשר ארוך במיוחד. מתאים למי שרוצה לעבד מסמכי ענק מקומית בלי לשלם על שרתים כבדים.

  • 137 GBמשקל הקבצים
  • 3,318הורדות בחודש
  • 42לייקים

מה זה

מדובר בהמרה של המודל המקורי של עליבאבא לפורמט GGUF באמצעות llama.cpp, שכוללת כיול imatrix לשימור הדיוק. המאפיין הבולט כאן הוא היכולת לבלוע קלט באורך חריג מאוד לגודל כזה, מה שמאפשר להזין תיעוד טכני שלם או קוד מקור רחב לתוך פרומפט אחד.

רוב המודלים בנפח של שבעה מיליארד פרמטרים נחנקים או מאבדים עקביות אחרי כמה עשרות אלפי טוקנים. כאן הדגש הוא על שמירת היכולת להבין הוראות גם כשהן קבורות בתוך הררי מלל, תוך שימוש בקבצים קטנים משמעותית מהמקור שמאפשרים עבודה מקומית שקטה.

מתאים ל

  • ניתוח מאגרי קוד

    קריאת מספר רב של קובצי פרויקט יחד, בזכות חלון ההקשר העצום שנתמך בארכיטקטורה.

  • תמצות תיעוד ארוך

    הזנת ספרים ומדריכים טכניים מלאים לקובץ אחד, מבלי לפצל את המידע לחלקים קטנים.

  • הרצה מקומית צנועה

    עבודה על מחשב נייד רגיל, הודות לקבצי קוונטיזציה של פחות מחמישה גיגה בייט.

איפה זה נופל

הנתונים בדף מתייחסים לאנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד טקסטים בעברית בלי לבדוק אותו קודם לעומק. מעבר לזה, רמות הדחיסה הנמוכות כמו Q2_K או Q3_K_S חותכות במשקל אבל מגיעות עם פגיעה מורגשת באיכות הפלט, והן לא מומלצות למשימות שדורשות דיוק עובדתי. יש גם בעיות תאימות טכניות, גרסאות ה־I-quant לא עובדות עם Vulkan, ופורמטי ה־Q4 הישנים כבר לא נתמכים בבניות עדכניות של llama.cpp.

אותה משפחה

Qwen2.5 יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי לי להוריד אם יש לי כרטיס מסך של 8GB?

לכו על Q4_K_M או Q5_K_M. שניהם שוקלים סביב חמישה גיגה בייט, ייכנסו במלואם לזיכרון הגרפי וישאירו מקום סביר לחלון ההקשר ולמערכת.

האם המודל ירוץ מהר על מעבד של מחשב ללא כרטיס גרפי ייעודי?

הוא יעבוד, במיוחד בגרסאות Q4_0 או IQ4_NL שמנצלות אופטימיזציה למעבדי ARM ו־AVX. עם זאת, יצירת הטקסט תהיה איטית משמעותית לעומת ריצה על מעבד גרפי.

האם גרסאות IQ החדשות עדיפות על גרסאות K הוותיקות?

אם אתם יורדים מתחת ל־Q4 ומשתמשים בכרטיסי Nvidia או AMD עם דרייבר rocBLAS, גרסאות ה־IQ נותנות איכות טובה יותר לנפח שלהן. במעבדים רגילים או בסביבת Vulkan עדיף להישאר עם גרסאות ה־K כדי למנוע ירידה בקצב היצירה.

איך מריצים

בשביל להריץ את גרסת ברירת המחדל המומלצת, Q4_K_M, תצטרכו קובץ של 4.68 גיגה בייט וכרטיס מסך עם לפחות שישה גיגה זיכרון כדי לעבוד מהר, אם כי אפשר לזרוק אותו גם על הזיכרון של המחשב דרך LM Studio. הגרסאות מתחילות בקבצים מכווצים מאוד כמו IQ2_M במשקל 2.78 גיגה בייט שמתאימים למכשירים מוגבלים, ומגיעות עד f32 במשקל 30.47 גיגה בייט שדורש חומרה מקצועית.

אם יש לכם מעבדי ARM או AVX, מומלץ לבדוק את Q4_0 או IQ4_NL שמנצלים אריזת משקלים מחדש בזמן ריצה לשיפור ביצועים. מי שצריך לעבד חלון הקשר מלא עד לקצה יגלה שצריכת הזיכרון מתנפחת מעבר למשקל הקובץ עצמו, ובמצב כזה עדיף לעבור לשרת ייעודי או לשלם לספק ענן חיצוני לפי טוקנים.

ollama run hf.co/bartowski/Qwen2.5-7B-Instruct-1M-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית. אתם יכולים לשלב אותו במוצר פנימי או מסחרי בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗