GPT
L

LongWriter-Zero-32B

קוד פתוח

THU-KEGapache-2.02025-06-18

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • reinforcement-learning

גרסה מכווננת של קוון שמייצרת טקסטים של מעל עשרת אלפים טוקנים ברצף. היא נבנתה במיוחד כדי לכתוב מאמרים ודוחות ארוכים בלי להתפזר ובלי לחזור על עצמה.

  • 33Bפרמטרים
  • 32,768טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 115הורדות בחודש

מה זה

הבסיס פה הוא מודל של שלושים ושניים מיליארד פרמטרים שעבר אימון המשך על ספרים ודוחות טכניים, ולאחר מכן חיזוק באמצעות למידת חיזוק ישירה. במקום לקצר או לקטוע תשובות, הוא מתוכנן לתכנן את הטקסט בתוך תגיות חשיבה ייעודיות לפני שהוא מתחיל לפלוט את התוכן עצמו.

המפתחים כיוונו אותו לשמור על מבנה ולמנוע שכפול פסקאות, תופעה שקוראת המון כשמבקשים ממודלים פתוחים לכתוב באריכות. לפי הבדיקות של הצוות במדדי כתיבה והשוואות מול מודלים אחרים, הוא עוקף מודלים פתוחים בגודל דומה ומגיע לביצועים שמיוחסים בדרך כלל למודלים כבדים בהרבה.

מתאים ל

  • דוחות מחקר מקיפים

    הוא מסוגל לפלוט עשרת אלפים טוקנים ברצף תוך שמירה על מבנה וחלוקה לנושאים בלי לאבד את הקו.

  • טיוטות לספרים ומדריכים

    אימון ההמשך על ספרים שלמים נותן לו יכולת להחזיק עלילה או הסבר טכני מורכב לאורך עשרות עמודים.

  • סקירות טכניות ארוכות

    מנגנון החשיבה המובנה עוזר לו לתכנן פרקים שלמים מראש במקום לקטוע את הפירוט באמצע.

איפה זה נופל

המודל הזה אומן על אנגלית וסינית בלבד, כך שלא הייתי בונה עליו לכתיבה בעברית. בנוסף, הוא מתוכנן לפלוט בלוקים של חשיבה לפני התשובה, מה שאומר זמן המתנה מורגש עד לקבלת הטוקן הראשון של התוכן בפועל. הטוקנייזר שלו שונה מגרסת ההוראות המקורית, וזה דורש התאמה של תבניות השיחה כדי לא לשבור את המבנה.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות מול משתמשי קצה בצ'אט רגיל?

לא מומלץ. בגלל שלב החשיבה הארוך והנטייה שלו להפיק אלפי מילים, המענה שלו איטי בהרבה מצ'אט סטנדרטי. הוא מיועד למשימות אצווה של יצירת מסמכים ולא לשיחה אינטראקטיבית מהירה.

האם הוא יעבוד טוב בעברית?

הכרטיס מצהיר על תמיכה באנגלית ובסינית בלבד. למרות שהבסיס מכיר שפות נוספות, אימון ההמשך והחיזוק התמקדו בשפות האלה, ולכן ניסיון לייצר טקסט ארוך בעברית כנראה ייכשל.

איך מריצים

בשביל להריץ אותו במשקל מלא של שישים ואחד ג'יגה בייט תצטרכו שרת עם לפחות שני כרטיסי שמונים ג'יגה או קוונטיזציה אגרסיבית שתוריד את דרישות הזיכרון. המפתחים ממליצים להריץ אותו דרך מנועים ייעודיים כמו אס ג'י לאנג כדי לנהל את חלון ההקשר הגדול והפלט הארוך בלי לחנוק את המעבד הגרפי.

אם אתם רק בודקים את היכולות ולא מחזיקים תשתית ענן ייעודית, עדיף להרים שרת לפי שעה או לבדוק נקודת קצה קיימת. להחזיק מפלצת כזו דלוקה באופן קבוע זה עסק יקר שמתאים רק למי שמייצר טקסטים ארוכים מסביב לשעון.

from transformers import pipeline

pipe = pipeline("text-generation", model="THU-KEG/LongWriter-Zero-32B")
print(pipe("שלום"))

הרישיון

רישיון אפאצ'י שתיים מאפשר שימוש חופשי בקוד ובמשקלים, כולל שימוש מסחרי, שינוי והפצה של המודל בתוך מוצרים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובת פתיחת קוד של הפיתוחים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗