GPT
W

WizardCoder-15B-1.0-GPTQ

קוד פתוח

TheBlokebigcode-openrail-m2023-06-14

  • transformers
  • safetensors
  • gpt_bigcode
  • text-generation
  • text-generation-inference

גרסת GPTQ דחוסה למודל קוד של 16 מיליארד פרמטרים. היא נכנסת לכרטיס מסך בודד ומיועדת למי שרוצה ביצועי פיתוח חזקים בלי לשלוח שורות קוד לשרתים חיצוניים.

  • 16Bפרמטרים
  • 8,192טוקנים בהקשר
  • 8.6 GBמשקל הקבצים
  • 80הורדות בחודש

מה זה

מדובר במודל WizardCoder המקורי, שעבר אימון על בסיס StarCoder בעזרת שיטת Evol-Instruct עם 78 אלף הוראות קוד מורכבות, ואז נדחס ל־4 ביט על ידי TheBloke באמצעות AutoGPTQ. הדחיסה הזו מכווצת את כל המשקלים לקובץ של 8.6 גיגה-בייט בלי לפרק את המודל ליותר מדי חלקים.

במדד HumanEval המודל רושם ציון pass@1 של 57.3 בהרצה של 20 דגימות, או 59.8 בדגימה בודדת. המספר הזה אומר שביותר ממחצית מהמקרים הוא מייצר פונקציית פייתון שעוברת את כל בדיקות היחידה בניסיון הראשון, תוצאה שעוקפת מודלים פתוחים אחרים מאותה תקופה ומשאירה מאחור מודלים גדולים בהרבה כמו PaLM או גרסאות קודמות של קלוד ובארד.

מתאים ל

  • השלמת פונקציות בפייתון

    הוא משיג מעל 57 אחוז הצלחה במבחני HumanEval, מה שהופך אותו למדויק ביצירת אלגוריתמים לפי הגדרת משימה.

  • פיתוח פנימי בסביבה סגורה

    המשקל הנמוך מאפשר להריץ אותו מקומית על כרטיס בודד בלי לחשוף קוד קנייני לשירותי ענן צד שלישי.

  • פתרון באגים מונחה הוראות

    האימון על 78 אלף דוגמאות מורכבות מאפשר לו לעקוב אחרי הנחיות ספציפיות לתיקון שגיאות בקוד קיים באנגלית.

איפה זה נופל

היוצרים מציינים במפורש שהדמו והאימון תומכים כרגע בהוראות קוד באנגלית בלבד. פנייה בעברית או ניסיון לקבל הסברים בשפה שאינה אנגלית יובילו לפלט שבור או חסר תועלת.

בנוסף, האימון התבצע על אורך מקסימלי של 2,048 טוקנים בלבד, כך שלמרות שארכיטקטורת הבסיס מאפשרת חלון רחב יותר, המודל מתקשה לשמור על לכידות בהוראות ארוכות מאוד. החומר גם מזהיר שהפלט מושפע מאי-ודאות ואינו מבטיח דיוק, כך שחובה להריץ בדיקות על כל קוד לפני הטמעה.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ אותו?

הקובץ שוקל 8.6 גיגה-בייט, ולכן כרטיס עם 12 גיגה-בייט זיכרון יספיק למשימות בסיסיות. אם אתם מתכננים לנצל את מלוא ההקשר של 8,192 טוקנים, תצטרכו כרטיס של 16 גיגה-בייט VRAM ומעלה.

האם המודל מבין הוראות שנכתבו בעברית?

לא. כרטיס המודל מצהיר במפורש שהתמיכה קיימת להוראות קוד באנגלית בלבד. מתן הנחיות בעברית יפגע בביצועים ויניב תוצאות לא שמישות.

איך מריצים

בזכות הדחיסה ל־4 ביט ללא group_size, אפשר להריץ את המודל על כרטיס מסך יחיד עם 12 גיגה-בייט VRAM, או 16 גיגה-בייט אם רוצים לנצל את חלון ההקשר המלא שמגיע ל־8,192 טוקנים. הריצה מתבצעת ישירות דרך ספריית AutoGPTQ בקוד פייתון או דרך ממשק text-generation-webui, כאשר קובץ התצורה טוען את הגדרות ה־act-order לבד.

אם אין לכם GPU מקומי מתאים עם תמיכה ב־CUDA, חבל על המאמץ של שכירת שרת ייעודי רק בשבילו. במצב כזה, שימוש בממשקי API של שירותים ענניים יספק מהירות גבוהה בהרבה בעלות נמוכה יותר.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/WizardCoder-15B-1.0-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון המדווח הוא bigcode-openrail-m, אבל בכרטיס המודל המקורי הצוות הוסיף הבהרה מגבילה שמייעדת את המשקלים למחקר אקדמי בלבד ואוסרת שימוש מסחרי. מי שבונה מוצר מסחרי לא יכול להשתמש בקבצים האלה בצורה חוקית.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗