GPT
Q

Qwen2.5-Coder-7B-Instruct-128K-GGUF

קוד פתוח

unslothapache-2.02024-11-12

  • transformers
  • gguf
  • qwen2
  • unsloth
  • code

גרסת GGUF של מודל קוד בגודל שבעה מיליארד פרמטרים עם הקשר מורחב של מאה עשרים ושמונה אלף טוקנים. פתרון שנועד לניתוח קבצי קוד ארוכים ישירות על חומרה מקומית סבירה.

  • 43.3 GBמשקל הקבצים
  • 13,987הורדות בחודש
  • 40לייקים

מה זה

מדובר במודל ייעודי לפיתוח וכתיבת תוכנה מסדרת Qwen2.5, שהומר לפורמט GGUF על ידי צוות unsloth. המודל עבר הרחבת הקשר ל־128K טוקנים באמצעות שיטת YaRN, בניגוד לגרסת הבסיס שמגיעה עם שלושים ושניים אלף בלבד. לפי נתוני היצרן, הסדרה אומנה על חמישה וחצי טריליון טוקנים של קוד, טקסט ונתונים סינתטיים במטרה לשפר יכולות של יצירת קוד, הסקת מסקנות ותיקון שגיאות.

ההרחבה לחלון הקשר ענק מאפשרת להזין לתוכו קבצים שלמים או ספריות קטנות בלי לחתוך אותם מראש לחתיכות קטנות. עם שבעה מיליארד פרמטרים בלבד, הוא מנסה לתת מענה לעבודה מקומית שלא דורשת שרתי ענק, אך מותאמת ישירות להנחיות ולשיחה עם מפתח.

מתאים ל

  • הסבר וניתוח קבצי קוד

    חלון הקשר של מאה עשרים ושמונה אלף טוקנים מאפשר לקרוא קבצים ארוכים ולמצוא בעיות תכנון.

  • תיקון שגיאות מקומי

    אימון ממוקד קוד על חמישה וחצי טריליון טוקנים מסייע באיתור באגים והצעת חלופות.

  • עבודה מבוססת הנחיות

    גרסת Instruct מתאימה למענה ישיר לשאלות מתכנתים ללא צורך באימון נוסף.

איפה זה נופל

שפת המודל המוגדרת היא אנגלית בלבד, כך שלא כדאי לבנות עליו לעבודה בעברית או לתיעוד מקומי. בנוסף, כרטיס המודל כולל בלבול פנימי וטוען בטקסט שמדובר במודל בסיס של חצי מיליארד פרמטרים, למרות שהכותרת והמזהה מדברים על מודל שבעה מיליארד שעבר התאמה להוראות. הרחבת הקשר באמצעות YaRN עלולה להציג ירידה באיכות התשובות בקצוות הזיכרון, וחובה לבדוק היטב דיוק של תיקוני באגים לפני שילוב ישיר בסביבת עבודה אמיתית.

אותה משפחה

Qwen2.5-Coder יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם חייבים כרטיס מסך כדי להריץ את המודל?

לא חובה. פורמט GGUF נתמך היטב על גבי מעבדים רגילים, אך כרטיס מסך ייעודי יאיץ משמעותית את מהירות יצירת הטקסט, בעיקר בהקשרים ארוכים.

למה יש עשרה קבצים שונים בהורדה?

הקבצים מייצגים רמות דחיסה שונות של המודל. מורידים רק קובץ אחד לפי כמות הזיכרון הפנויה והאיכות הרצויה, ואין צורך להוריד את כל ארבעים ושלושת הגיגה.

איך מריצים

המודל מגיע בחבילה של 10 קבצי GGUF במשקל כולל של 43.3 גיגה בייט, שמכילים רמות כימות שונות. כדי להריץ קובץ יחיד מכומת של שבעה מיליארד פרמטרים, תצטרכו כרטיס מסך בודד עם 8 עד 16 גיגה זיכרון, או מעבד חזק עם מספיק זיכרון מערכת, באמצעות כלים שתומכים בפורמט כמו llama.cpp.

אם אתם מתכוונים לנצל את מלוא חלון ההקשר של מאה עשרים ושמונה אלף טוקנים, תוספת הזיכרון עבור זיכרון ההקשר תהיה כבדה ותדרוש משאבים רבים. במקרים שבהם צריך לנתח פרויקט שלם בקביעות ואין ברשותכם כרטיס עם זיכרון ייעודי מספק, עדיף להשתמש בפתרון ענן מרוחק.

ollama run hf.co/unsloth/Qwen2.5-Coder-7B-Instruct-128K-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי ולא מטילים אחריות משפטית על המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗