GPT
Q

Qwen2.5-Coder-14B-Instruct-128K-GGUF

קוד פתוח

unslothapache-2.02024-11-12

  • transformers
  • gguf
  • qwen2
  • unsloth
  • code

גרסת GGUF ייעודית לכתיבת קוד עם הרחבת הקשר שמגיעה ל־128K טוקנים. מתאימה למי שרוצה להריץ לוקאלית מודל שמבין ריפו שלם בלי לחרוג מהתקציב.

  • 83.8 GBמשקל הקבצים
  • 8,585הורדות בחודש
  • 49לייקים

מה זה

מדובר במודל שמכוון ישירות למפתחים, עם התמחות ביצירת קוד, ניפוי שגיאות והסבר של לוגיקה קיימת. הוא שייך למשפחת המודלים של Qwen2.5 לקוד, שאומנה על כמות עצומה של 5.5 טריליון טוקנים שכוללים שפות תכנות מגוונות, טקסט טכני ונתונים סינתטיים. ההבדל המרכזי בגרסה הזו הוא השילוב של YaRN להרחבת חלון ההקשר מ־32K המקוריים עד ל־128K מלאים, מה שמאפשר לדחוף פנימה קבצים מרובים במקביל מבלי לאבד את ההקשר של הפרויקט.

בגודל של 14B מדובר בפשרה טובה בין מודלים קטנים מדי שמייצרים הזיות בקוד מורכב, לבין מפלצות כמו גרסת ה־32B שדורשות כרטיסי מסך יקרים בהרבה. הוא מגיע כבר אחרי כוונון להוראות ולא כמודל בסיס גולמי, כך שאפשר לתשאל אותו ישירות כמו עוזר פיתוח, להטמיע אותו בתוך סוכן אוטומטי, או להשתמש בו לקריאת תיעוד טכני לצד הקוד עצמו.

מתאים ל

  • סקירת קוד לפרויקטים

    חלון ההקשר העצום מתאים להזנה של כמה קבצי מקור במקביל כדי למצוא באגים ותלויות שבורות.

  • עוזר פיתוח בסביבה מקומית

    משקל של 14B מאפשר קבלת השלמות קוד חכמות ותשובות טכניות ישירות מהמחשב ללא תלות ברשת.

  • בניית סוכני קוד אוטונומיים

    אימון המקור הותאם ספציפית לפעולות סוכן, פתרון בעיות מתמטיות והסקת מסקנות רב שלבית.

איפה זה נופל

הכרטיס מצהיר על אנגלית בלבד, כך שלא כדאי לבנות עליו לעבודה עם שמות משתנים, הערות או תיעוד בעברית, שם הוא צפוי לזייף. בנוסף, מודלים שמרחיבים הקשר באמצעות שיטות כמו YaRN נוטים לאבד דיוק בקצוות הרחוקים של החלון לעומת אימון מקורי על אותו אורך. דפי המודל עצמם סובלים מחוסר עקביות וכוללים טקסט שמתייחס לגרסת 0.5B או 1.5B, מה שמחייב לבדוק היטב שהקובץ שאתם מורידים אכן מתנהג כמצופה מגרסת 14B לפני שסומכים עליו.

אותה משפחה

Qwen2.5-Coder יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מבין הערות בקוד שנכתבו בעברית?

הנתונים הרשמיים מגדירים את המודל לשפה האנגלית בלבד. הוא עשוי לזהות מילים בודדות, אך יתקשה מאוד להבין הנחיות או לתעד קוד בעברית.

למה מופיעים פרטים על מודל 0.5B בתוך הכרטיס?

יוצרי המאגר העתיקו חלקים מתיעוד של מודל אחר בסדרה. המזהה והקבצים עצמם שייכים לגרסת ה־14B, אך הבלבול בטקסט דורש בדיקה זהירה של הקבצים לאחר ההורדה.

איך מריצים

המודל מופץ בפורמט GGUF, כך שההרצה נעשית ישירות בכלים שתומכים בספריית transformers ובקוונטיזציות, למשל דרך מחשבי קולאב עם כרטיסי T4 או חומרה מקומית. סך כל הקבצים שוקל כ־83.8GB שמחולקים לעשרה קבצים שונים, מה שאומר שיש כאן מספר דרגות דחיסה ואתם מורידים רק את הקובץ שמתאים לזיכרון שלכם.

גרסאות מכווצות ברמה בינונית ידרשו כרטיס עם לפחות 12GB עד 16GB של VRAM כדי לרוץ בצורה חלקה. אם אתם מתכננים לנצל את כל 128K הטוקנים בבת אחת, צריכת הזיכרון תזנק באופן משמעותי בגלל זיכרון ה־KV, ובמקרה כזה עדיף לשקול שימוש ב־API חיצוני של שרת ענן במקום לחנוק את המחשב המקומי.

ollama run hf.co/unsloth/Qwen2.5-Coder-14B-Instruct-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי, שינוי הקוד, שילוב שלו בתוך מוצר סגור והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗