GPT
L

Llama3.3-8B-Instruct-Thinking-Claude-4.5-Opus-High-Reasoning

קוד פתוח

DavidAUapache-2.02026-01-01

  • transformers
  • safetensors
  • llama
  • text-generation
  • thinking

המודל מביא תהליך חשיבה מפורט לגודל של שמונה מיליארד פרמטרים. הוא מיועד למי שמחפש פלט מנומק ומובנה בלי להחזיק שרת כבד.

  • 8Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 618הורדות בחודש

מה זה

הבסיס כאן הוא משקל של Llama 3.3 בגודל שמונה מיליארד פרמטרים שעבר אימון על דאטה־סט חשיבה שחולץ מקלוד 4.5 אופוס. היוצר אימן אותו בשלושה מחזורים בעזרת Unsloth כדי להקנות לו דפוס פעולה היברידי. מילות מפתח מסוימות מפעילות בלוק חשיבה עצמאי שמנתח את הבעיה לפני יצירת המענה, בזמן שהוראות רגילות מייצרות פלט ישיר.

האימון לא נועד לשנות או לעדכן את הידע הבסיסי של המודל, אלא להקנות מתודולוגיית עבודה של פירוק בעיות. בדוגמה שצורפה עם שאלת מכניקת מסלולים, המודל מקדיש כעשרים שניות לתכנון מבנה התשובה וגזירות מתמטיות, ורק אז פולט מדריך הנדסי מפורט ומסודר. אין בכרטיס מבחני ביצועים רשמיים, כך שההבדל העיקרי מול מודלים רגילים בגודל הזה הוא התנהגותי נטו.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא מפרק שאלות חישוביות לשלבים ומציג את דרך הגזירה המלאה בתוך בלוק החשיבה לפני הפלט.

  • משחקי תפקידים וכתיבה

    הגדרות הדגימה הייעודיות של המודל מאפשרות לו לבנות סיפורים עמוקים עם הקשר רחב של עד מאה עשרים ושמונה אלף טוקנים.

  • הסבר נושאים הנדסיים

    הוא מתכנן ראשי פרקים מראש ומפיק מסמכים טכניים מסודרים ברמת פירוט גבוהה יחסית לגודלו.

איפה זה נופל

היוצר מציין במפורש שהאימון לא עדכן את מאגר הידע של המודל. המשמעות היא שכל טעות, הטיה או חוסר דיוק שהיו במודל המקור עדיין שם, ובלוק החשיבה רק מנמק אותן בביטחון רב יותר.

מעבר לזה, המקור של המשקולות עצמן מבוסס על הדלפה לא רשמית ברשת ולא על שחרור מתועד ומאומת. רשימת השפות הנתמכות לא כוללת עברית, כך שלא כדאי לבנות עליו לעיבוד שפה מקומית מורכבת.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

הרישום הרשמי מציין שפות אירופיות, סינית ויפנית בלבד. הוא עשוי להבין מילים בודדות, אבל איכות החשיבה והניסוח בעברית תהיה נמוכה משמעותית ולא מתאימה לשימוש שוטף.

למה המודל חושב לפני חלק מהתשובות ועל אחרות עונה ישר?

הוא אומן להפעיל את תהליך החשיבה רק כשהוא מזהה ביטויים מסוימים כמו הוראה לחשוב לעומק. בפניות ישירות ופשוטות הוא ידלג על הבלוק כדי לחסוך זמן ולענות מיד.

איזה קוונטיזציה מומלץ להוריד למחשב מקומי?

היוצר ממליץ על רמת כיבוץ שלא יורדת מפורמט Q4_K_S. ירידה לרמות דחיסה נמוכות יותר תפגע ביכולת של המודל להפעיל את מנגנון החשיבה ותשבש את הלוגיקה שלו.

איך מריצים

כדי להריץ אותו בפורמט המקורי צריך כרטיס מסך עם לפחות שישה עשר גיגה זיכרון כדי להחזיק חמישה עשר גיגה של משקולות. אם ממירים אותו לפורמט GGUF מכווץ כמו Q4_K_S, אפשר להריץ אותו בקלות על מעבד גרפי ביתי פשוט עם שמונה גיגה זיכרון או ישירות על זיכרון המחשב. היוצר מזהיר שכיבוץ אגרסיבי מדי יפגע במנגנון החשיבה.

ההגדרה דורשת ביטול של פרומפט המערכת כדי שתגיות החשיבה ייווצרו לבד, ומומלץ לעבוד עם חלון הקשר של לפחות שמונה אלף טוקנים. אם אתם צריכים רק פלט פשוט ומהיר, חבל על המשאבים וזמן ההמתנה לבלוק החשיבה, ועדיף לקרוא למודל בסיסי דרך ספק חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="DavidAU/Llama3.3-8B-Instruct-Thinking-Claude-4.5-Opus-High-Reasoning")
print(pipe("שלום"))

הרישיון

הרישיון המדווח הוא אפאצ׳י שתיים, שמתיר שימוש מסחרי חופשי, שינוי קוד והפצה בלי תשלום תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים. יחד עם זאת, מאחר שהמשקולות מבוססות על מודל שהודלף ודאטה שחולץ ממודל קלוד, שילוב שלו במוצר מסחרי עלול לחשוף אתכם לסיכונים משפטיים מול תנאי השימוש של החברות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗