GPT
C

CodeQwen1.5-7B-Chat-GGUF

קוד פתוח

Qwenother2024-04-15

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת קוד ממוקדת של שבעה מיליארד פרמטרים שמגיעה מכווצת לריצה מקומית. מי שמחפש מודל שיבין הקשר רחב של קוד בלי לשלוח נתונים החוצה ימצא פה מענה ישיר.

  • 37.6 GBמשקל הקבצים
  • 1,469הורדות בחודש
  • 111לייקים

מה זה

מדובר במודל ייעודי לכתיבת תוכנה שעבר אימון על שלושה טריליון טוקנים של קוד, ותומך בשיחה ובהוראות ישירות. הוא מבוסס על סדרת Qwen1.5 וכולל תמיכה בתשעים ושתיים שפות תכנות שונות. היתרון המשמעותי כאן הוא חלון הקשר של שישים וארבעה אלף טוקנים, שמאפשר להזין קבצי קוד ארוכים או כמה מסמכים במקביל בלי לאבד את ההקשר מהר מדי.

בגודל של שבעה מיליארד פרמטרים, המודל משתמש בארכיטקטורת Group Query Attention כדי לייעל את מהירות הריצה וצריכת הזיכרון. המפתחים מכוונים אותו במיוחד למשימות של כתיבת שאילתות SQL מתוך תיאור מילולי, איתור ותיקון באגים, וכתיבת פונקציות מלאות.

מתאים ל

  • המרת שפה טבעית ל־SQL

    המודל אומן ספציפית למשימות text-to-SQL ומאפשר לייצר שאילתות מורכבות על בסיס סכמה נתונה.

  • תיקון באגים מקומי

    מאפשר לנתח קטעי קוד פגומים ולמצוא בעיות בלי להוציא קוד פנימי מחוץ למחשב הפיתוח.

  • עבודה מול קבצים ארוכים

    חלון של 64K טוקנים מתאים להזנה של קבצי מקור מלאים לשם תיעוד או שכתוב פונקציות.

איפה זה נופל

למרות חלון ההקשר הגדול, הרצה מקומית של שישים וארבעה אלף טוקנים דורשת משאבי זיכרון כבדים מאוד שמבטלים חלק מהיתרון של מודל קל. בנוסף, שפת הממשק המתועדת היא אנגלית בלבד, ואין מידע לגבי ביצועים בהוראות שנכתבות בעברית. שבעה מיליארד פרמטרים מוגבלים ביכולת לתפוס ארכיטקטורות מורכבות, וצריך לבדוק טוב את הקוד שהוא מייצר לפני שמריצים אותו בייצור.

אותה משפחה

CodeQwen1.5 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מהמאגר?

הגרסה המאוזנת ביותר לרוב המחשבים היא q5_k_m, ששומרת על דיוק סביר בלי לתפוס יותר מדי זיכרון. אם המחשב שלכם חלש במיוחד אפשר לרדת ל־q4_k_m, אבל מומלץ להימנע מכימותים נמוכים יותר שפוגעים משמעותית באיכות הקוד.

האם המודל מבין הוראות בעברית?

הכרטיס מציין רשמית תמיכה באנגלית בלבד. הוא מסוגל לקרוא שפות תכנות ללא תלות בשפה המדוברת, אבל כתיבת הנחיות בעברית עלולה להוביל לפספוסים בהבנה.

איך מריצים

המודל מופץ כקבצי GGUF שמיועדים להרצה דרך llama.cpp ישירות על המחשב. המאגר מכיל שמונה רמות כימות שונות, החל מכימות אגרסיבי כמו q2_k ועד q8_0 הכבד, כשהגרסה המאוזנת המומלצת בתיעוד היא q5_k_m. מורידים רק את הקובץ הספציפי שמתאים לחומרה שלכם באמצעות huggingface-cli כדי לא למשוך את כל שלושים ושבעה הגיגהבייט של המאגר.

בשביל להריץ גרסת ביניים בצורה שוטפת צריך מעבד סביר עם זיכרון עבודה פנוי של עשרה עד שישה עשר גיגהבייט, או כרטיס מסך עם זיכרון ייעודי דומה. אם אין לכם חומרה כזו מקומית, הקמה ותחזוקה של שרת כזה תעלה יותר מקריאה ל־API מנוהל.

ollama run hf.co/Qwen/CodeQwen1.5-7B-Chat-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ולא כקוד פתוח סטנדרטי מסוג MIT או Apache. המשמעות היא שיש מגבלות תנאים ייחודיות של משפחת מודלי Qwen שלא מפורטות במלואן בדף הזה. לפני שמשלבים את הקבצים במוצר מסחרי, חובה לפנות למאגר הראשי של הפרויקט כדי לבדוק האם השימוש שלכם מותר.

הרישיון המלא בעמוד המודל ↗