GPT
Q

Qwen2.5-Coder-32B-Instruct-abliterated-GGUF

קוד פתוח

bartowskiapache-2.02024-11-13

  • gguf
  • code
  • codeqwen
  • chat
  • qwen

גרסה מכווצת של מודל קוד חזק שעברה הסרת מגבלות סירוב, למי שצריך ניתוח מעמיק בלי שהמודל יסרב לבדוק חולשות אבטחה.

  • 490 GBמשקל הקבצים
  • 12,163הורדות בחודש
  • 49לייקים

מה זה

מדובר במודל Qwen2.5 בגרסת 32 מיליארד פרמטרים המיועדת לכתיבת קוד, שעברה תהליך של הסרת מגבלות סירוב (abliteration) על ידי huihui-ai, ונארזה כאן לקובצי GGUF על ידי bartowski באמצעות llama.cpp b4058. המטרה של התהליך היא למנוע מהמודל לסרב לבקשות לגיטימיות בתחומי אבטחת מידע, סקריפטים של חדירה, או קוד שנוי במחלוקת שמודלים רגילים נוטים לחסום מיד.

המשקלים עברו כיול imatrix עם דאטה-סט ייעודי, ומגיעים בטווח שנע בין f16 מלא בנפח של מעל 65GB ועד לקבצי 2 ביט של פחות מ־10GB. הפורמט הזה מאפשר להריץ מודל תכנות ברמה גבוהה ישירות על החומרה המקומית שלכם, ללא תלות ברשת וללא חשש שחברות ענן יציצו בקוד המקור שלכם.

מתאים ל

  • בדיקות חדירה ואבטחה

    ניתוח חולשות בקוד ופיתוח כלי בדיקה בלי להיתקל בסירובים אוטומטיים של המודל.

  • פיתוח אוף-ליין

    עבודה על בסיס קוד רגיש ומסווג שחייב להישאר על החומרה המקומית ללא חיבור רשת.

  • סביבות מבוססות ARM

    הרצה מואצת על חומרת ARM תואמת באמצעות קובצי הקוונטיזציה הייעודיים.

איפה זה נופל

הסרת המגבלות לא הופכת את המודל לחכם יותר, ולפעמים היא פוגעת ביציבות התשובות או גורמת להזיות בקוד מורכב. הוא מוגדר לשפה האנגלית בלבד, כך שלא הייתי בונה עליו להערות או תיעוד בעברית. בנוסף, גרסאות ה־IQ אינן תומכות ב־Vulkan, והפעלת המודל דורשת פורמט פרומפט מדויק של ChatML, אחרת איכות התשובות נפגעת משמעותית.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

הקובץ המאוזן ביותר הוא Q4_K_M בנפח של כמעט 20GB. הוא נותן פגיעה מינימלית באיכות לעומת המשקל המקורי ורץ טוב על כרטיסי מסך של 24GB.

האם המודל יפעל טוב על מעבדי אפל סיליקון?

כן, אפשר להריץ אותו דרך LM Studio או llama.cpp על מק. רק שימו לב להימנע מגרסאות ה־Q4_0_X_X שמיועדות לשבבי ARM ייעודיים עם הרחבות ספציפיות.

מה המשמעות של imatrix בגרסאות האלו?

תהליך הכיווץ השתמש בסט נתונים מיוחד כדי למדוד איזה משקלים קריטיים לרמת הדיוק. זה מאפשר לקבל תוצאות מדויקות יותר בגדלים הנמוכים יחסית לכיווץ סטנדרטי.

איך מריצים

כדי להריץ אותו מקומית, צריך כרטיס מסך עם זיכרון משמעותי או שילוב של זיכרון מערכת ו־VRAM. הגרסה המומלצת לרוב האנשים היא Q4_K_M ששוקלת 19.85GB, ודורשת כרטיס עם לפחות 24GB VRAM כדי לרוץ במהירות סבירה. אם הזיכרון חנוק, יש גרסאות IQ3 או Q3 שדורשות כ־15GB עד 17GB, אבל מתחת לזה, בגרסאות ה־2 ביט, מורגשת ירידה באיכות הפלט.

אתם יכולים לטעון את הקבצים ישירות בתוך LM Studio או להריץ אותם ב־llama.cpp. יש לשים לב שהגרסאות שמסומנות ב־Q4_0_X_X מיועדות למעבדי ARM בלבד ולא יעבדו כמו שצריך ב־Windows או Mac. אם אין לכם חומרה מתאימה עם לפחות 24GB זיכרון ייעודי, עדיף להשתמש בפתרונות ענן ולא לנסות להריץ אותו בכוח על מעבד רגיל.

ollama run hf.co/bartowski/Qwen2.5-Coder-32B-Instruct-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

30 קבצים במאגר, 490 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מדווח תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. אין כאן הגבלות מיוחדות על שילוב במוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗