GPT
N

Negentropy-claude-opus-4.7-9B-GGUF

קוד פתוח

Jackrongapache-2.02026-05-08

  • gguf
  • unsloth
  • qwen
  • qwen3.5
  • reasoning

ניסיון לשחזר שרשראות חשיבה עמוקות של מודלים סגורים בתוך מודל מקומי קומפקטי. הוא נועד למי שצריך היגיון רב שלבי על חומרה ביתית בלי לשלוח מידע החוצה.

  • 76.7 GBמשקל הקבצים
  • 2,128הורדות בחודש
  • 72לייקים

מה זה

בבסיס יושב Qwen3.5-9B שעבר כוונון בעזרת Unsloth על בסיס טכניקה שהיוצרים מכנים Trace Inversion. הרעיון הוא לקחת תקצירי חשיבה של מודלים מסחריים כמו קלוד אופוס, להרחיב אותם בחזרה לתהליך מחשבה מלא, ולהזין את הצעדים האלה כחומר אימון למודל קטן יותר. הוא פולט את תהליך ההסקה בתוך תגיות ייעודיות, כך שרואים את כל שלבי העבודה לפני התשובה הסופית.

ההבדל העיקרי מול מודלים אחרים באותו סדר גודל הוא המיקוד באיכות צעדי הביניים ולא רק בפלט הגולמי. למרות שהמשימה המוצהרת כוללת תמונה וטקסט, עיקר הדגש כאן הוא פירוק לוגי, פתרון בעיות קוד ומעקב אחרי אילוצים מורכבים לאורך שלבים מרובים.

מתאים ל

  • מחקר על שרשראות חשיבה

    מאפשר לבדוק שיטות שחזור היגיון פנימי של מודלים גדולים בסביבה מקומית מבוקרת.

  • יצירת דאטה להסקה

    יכול לשמש כמורה שמייצר נתוני אימון מפורטים עבור מודלים זעירים של פחות מארבעה מיליארד פרמטרים.

  • פתרון בעיות קוד מקומי

    מבצע ניתוח צעד אחר צעד של לוגיקה תכנותית בלי להוציא קבצים רגישים אל מחוץ לרשת.

איפה זה נופל

הכרטיס מזהיר במפורש מפני הזיות לוגיות. המודל יכול לייצר שרשרת חשיבה שנראית מנומקת, מסודרת ומובנית למופת, אבל המסקנה העובדתית בסופה שגויה לחלוטין. בנוסף, קצב ייצור הטוקנים נמוך מגרסאות קטנות יותר כמו גרסת ה־4B, ועברית אינה מופיעה ברשימת השפות הנתמכות שכוללת רק אנגלית, סינית, קוריאנית, יפנית ורוסית.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל הוגדר רשמית עבור אנגלית, סינית, קוריאנית, יפנית ורוסית. הוא עשוי לפלוט מילים בעברית בזכות משקלי הבסיס של Qwen, אבל איכות החשיבה והפלט בשפה הזו אינה מובטחת ולא נבדקה.

כמה זיכרון גרפי נחוץ כדי להפעיל אותו?

דרושים לפחות 8 עד 12 גיגה בייט זיכרון גרפי עבור כימות 4 ביט. חומרה כמו RTX 3090 או 4090 תספק סביבת עבודה נוחה למשימות הסקה מורכבות.

איך מריצים

קובצי ה־GGUF מאפשרים להריץ אותו דרך ספריות כמו llama.cpp על מעבדים גרפיים שולחניים כמו סדרות RTX 3090, 4090 או 5090. עבור עבודה נוחה בכימות של ארבעה ביטים תצטרכו לפחות 8 עד 12 גיגה בייט של זיכרון גרפי, תלוי ברמת הכימות ובאורך ההקשר.

אם יש לכם כרטיס מתאים וצורך בפרטיות מוחלטת או במחקר מקומי, ההרצה משתלמת ועובדת היטב. אם המטרה היא מענה מהיר במיוחד למשתמשי קצה בנפח תנועה גבוה, כדאי לשקול קריאה ל־API של מודל חיצוני במקום להחזיק שרת ייעודי.

ollama run hf.co/Jackrong/Negentropy-claude-opus-4.7-9B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי, שינוי קוד ושילוב במוצרים מסחריים ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗