GPT
C

Crow-9B-HERETIC-4.6

קוד פתוח

Crowneliusרישיון לא דווח2026-03-03

  • safetensors
  • gguf
  • qwen3_5
  • agent
  • en

שילוב בין בסיס של תשעה מיליארד פרמטרים לזיקוק ישיר מתוך קלוד אופוס. הוא מיועד למי שמחפש יכולות חשיבה וניסוח מתקדמות בלי להחזיק שרת כבד.

  • 262,144טוקנים בהקשר
  • 55.3 GBמשקל הקבצים
  • 4,783הורדות בחודש
  • 282לייקים

מה זה

הבסיס כאן הוא Qwen 3.5 בגודל של תשעה מיליארד פרמטרים, שעבר תהליך זיקוק מול המודל Claude Opus 4.6. המטרה היתה להעביר את סגנון ההסקה, ההיצמדות להוראות ויכולת הניסוח המורכבת של מודל ענק לתוך מסגרת קומפקטית בהרבה. הוא מגיע עם תמיכה רחבה בשפות בזכות ארכיטקטורת הבסיס, ויודע להתמודד עם משימות קוד, כתיבה ודיאלוג ארוך.

היתרון שלו על פני מודלים גנריים בגודל הזה הוא המשקל של מודל המקור. הזיקוק אמור לתת לו יתרון במבנה התשובות ובניתוח לוגי ישיר, מבלי לדרוש משאבים של מעבדת מחקר. מעבר לזה, קיימת גרסת מולטימודל עם קובץ ייעודי לעיבוד תמונה, מה שמרחיב את טווח השימוש שלו מעבר לטקסט נקי.

מתאים ל

  • עוזר פיתוח מקומי

    מנתח קוד ופותר בעיות לוגיות על חומרה ביתית, תוך שימוש ביכולות ההסקה שזוקקו מקלוד.

  • כתיבה ועריכת טקסט ארוך

    שומר על עקביות של סגנון ודמויות בטמפרטורה של 0.8 ובחלונות הקשר בינוניים.

  • ניתוח מסמכים בלי ענן

    מאפשר הרצה של טקסטים רגישים על שרת פנימי ללא צורך בהוצאת נתונים ל־API חיצוני.

איפה זה נופל

הבעיה הבולטת ביותר היא נטייה להיכנס ללולאות חשיבה אינסופיות בתוך תגיות החשיבה שלו, תקיעה ומריחת זמן בניתוח עצמי במקום מתן מענה. כשזה קורה, נדרשת התערבות ידנית: הורדת הטמפרטורה, העלאת ענישה על חזרתיות, או חיתוך הפרומפט מחדש. בנוסף, בכימותים נמוכים התופעה מחמירה, והוא נוטה לעצור באמצע התשובה או להתחיל אותה מחדש אם ההנחיות לא מוגדרות בצורה מדויקת וקשיחה.

שאלות
נפוצות

האם כדאי לפתוח את כל חלון ההקשר המקסימלי?

לא. פתיחת החלון המלא תגמור את ה־VRAM במהירות ותגרום למודל להאט או לקרוס. ההמלצה היא להגדיר 16,384 טוקנים לשימוש שוטף ולהגדיל רק במידת הצורך.

מה עושים כשהמודל נתקע בלולאות חשיבה?

מורידים את הטמפרטורה לכיוון 0.4 עד 0.6 ומעלים מעט את ה־repeat penalty. אפשר גם להוסיף להנחיית המערכת דרישה מפורשת לענות מיד ולוותר על ניתוח פנימי חוזר.

איזו גרסת כימות הכי כדאי להוריד?

עבור רוב כרטיסי המסך הביתיים, גרסת Q5_K_M נותנת את התוצאה הטובה ביותר בלי לאבד את יתרונות הזיקוק. אם חסר זיכרון אפשר לבחור ב־Q4_K_M, אך הסיכון לתקלות בניסוח עולה מעט.

איך מריצים

המשקל המקורי מגיע בפורמט bfloat16 על פני 55.3 גיגה בייט, אבל בפועל מריצים אותו דרך קובצי GGUF עם LM Studio או Ollama. למשתמש הממוצע מומלץ להתחיל מגרסת כימות Q5_K_M שמאזנת בין איכות הזיכרון לביצועים, או לרדת ל־Q4_K_M אם המשאבים לחוצים. מי שמחפש מקסימום דיוק ומשתמש בחומרה חזקה יכול לטעון קובצי Q8_0 או F16.

למרות שארכיטקטורת הבסיס תומכת בחלון של עד 262,144 טוקנים, היוצר ממליץ במפורש לא לפתוח את כל החלון בהרצה מקומית. פתיחה כזו תחנוק את הזיכרון של כרטיס המסך ותפגע ביציבות. מומלץ להגדיר חלון של 16,384 טוקנים בטמפרטורה סביב 0.6, ובמקרים של כתיבה יצירתית לעלות ל־32,768 טוקנים עם טמפרטורה של 0.8.

ollama run hf.co/Crownelius/Crow-9B-HERETIC-4.6:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בעמוד המודל לא דווח רישיון רשמי, אף שבכרטיס מופיע תג של Apache 2.0. אי ההתאמה הזו מייצרת סיכון משפטי עבור מי שמתכנן להטמיע אותו במוצר מסחרי. כל עוד המפתח לא הסדיר את הרישום הרשמי במאגר, אין ודאות מוחלטת לגבי תנאי ההפצה או השימוש המסחרי.

הרישיון המלא בעמוד המודל ↗