GPT
C

cerebras_Qwen3-Coder-REAP-25B-A3B-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-10-20

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת של מודל קוד מבית Cerebras, המיועדת להרצה מקומית יעילה על גבי llama.cpp או LM Studio בלי צורך בחומרת שרתים יקרה.

  • 371 GBמשקל הקבצים
  • 3,221הורדות בחודש
  • 47לייקים

מה זה

מדובר במארז כימותים בפורמט GGUF עבור המודל Qwen3-Coder-REAP-25B-A3B של חברת Cerebras, שהומר על ידי bartowski בעזרת llama.cpp בגרסה b6810. המודל שייך למשפחת מודלי הקוד ומיועד ליצירת טקסט ותכנות. התהליך כלל שימוש בכיול imatrix עם דאטה-סטים ייעודיים, כדי לצמצם את אובדן האיכות שנוצר בדחיסה.

המייחד את ההפצה הזו הוא מגוון רחב של רמות כימות, החל מקבצי bf16 מלאים במשקל 49.76GB ועד לכימותי IQ2 זעירים שמגיעים ל־6.23GB. חלק מהגרסאות, כמו Q4_K_L או Q6_K_L, משמרות את משקלי ה־embeddings וה־output ברמת Q8_0, מה שמספק דיוק גבוה יותר בחלקים הרגישים של הרשת בהשוואה לכימות סטנדרטי.

מתאים ל

  • פיתוח מקומי ללא רשת

    מאפשר הרצת מודל קוד בתוך סביבות פיתוח מנותקות מאינטרנט על גבי חומרת תחנת עבודה סבירה.

  • השלמת קוד בזיכרון מוגבל

    שימוש בגרסאות IQ4_XS או Q4_K_M מאפשר שילוב סביר של מהירות וחיסכון במקום בכרטיסי מסך ביתיים.

  • בדיקת איכות כימותים

    מתאים למפתחי תשתית שרוצים להשוות ביצועים בין שיטות כימות שונות כמו K-quants לבין I-quants.

איפה זה נופל

המפרסם מציין במפורש שלא הוגדר תבנית צ'אט מקורית, ולכן llama.cpp משתמש בברירת מחדל של ChatML, מה שעלול להיות שגוי ולפגוע ישירות בהבנת ההוראות ובפלט. בנוסף, בגרסאות המכווצות ביותר כמו סדרות Q2 ו־IQ2 מוגדרת רמת איכות נמוכה מאוד, כך שהן עלולות לפלוט שגיאות תחביר בקוד או הזיות.

חובה לבדוק את התנהגות הפרומפטים מול כרטיס המודל המקורי של Cerebras לפני שמשלבים אותו במערכת פעילה.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד?

ברירת המחדל המתאימה לרוב המשתמשים היא Q4_K_M, ששוקלת 15.19GB ומאזנת היטב בין איכות המודל לדרישות החומרה. אם יש לכם כרטיס מסך עם מספיק זיכרון, גרסאות Q5_K_M או Q6_K יתנו דיוק גבוה יותר שמתקרב למקור.

האם המודל יעבוד טוב על מעבדי ARM או מעבדים רגילים?

כן, llama.cpp כולל תמיכה באריזה מחדש בזמן ריצה עבור קובצי Q4_0 במעבדי ARM ו־AVX, וקובץ IQ4_NL מציע התאמה דומה ל־ARM. עם זאת, ריצה על מעבד בלבד תהיה תמיד איטית משמעותית בהשוואה להרצה מלאה על כרטיס מסך.

איך מריצים

אתם מורידים קובץ בודד בהתאם לזיכרון הפנוי שלכם ומריצים אותו דרך LM Studio או ישירות ב־llama.cpp. מי שרוצה ביצועים מהירים חייב להכניס את כל הקובץ לזיכרון ה־VRAM של כרטיס המסך, כשלרוב המשתמשים מומלץ לבחור בגרסת Q4_K_M שדורשת 15.19GB או בגרסאות Q5 הדורשות כ־18GB.

אם אין לכם לפחות כרטיס מסך של 16GB עד 24GB, המודל יישפך לזיכרון ה־RAM של המחשב וירוץ לאט מאוד על המעבד. במצב כזה, או אם אתם עובדים על חומרה חלשה במיוחד, עדיף לפנות ל־API חיצוני במקום לחכות שניות ארוכות לכל טוקן.

ollama run hf.co/bartowski/cerebras_Qwen3-Coder-REAP-25B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

30 קבצים במאגר, 371 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. מבחינה משפטית, היעדר רישיון מפורש אומר שאין לכם היתר שימוש ברור, לא לשימוש אישי ובוודאי שלא להטמעה מסחרית במוצר, עד שלא תבדקו את תנאי הרישיון המקוריים שפרסמה Cerebras.

הרישיון המלא בעמוד המודל ↗