GPT
Q

QwenLong-L1-32B

קוד פתוח

Tongyi-Zhiwenapache-2.02025-05-23

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • long-context

זה מודל חשיבה של 33 מיליארד פרמטרים שעבר אימון בחיזוקים ספציפית למסמכים ארוכים. הוא מיועד למי שרוצה יכולות הסקה עמוקות על טקסט ענק בלי לשלם על מודל ענק.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 61.0 GBמשקל הקבצים
  • 83הורדות בחודש

מה זה

הצוות של עליבאבא לקח בסיס ממשפחת Qwen2 ואימן אותו בחיזוקים באמצעות אלגוריתמים כמו GRPO ודאפו עם דאטהסט ייעודי בשם DocQA-RL-1.6K. המטרה שלהם הייתה לפתור את הנפילה הרגילה שמודלי חשיבה חווים כשהקלט נמתח. הם מתמקדים בשאלות ותשובות על גבי מסמכים שמצריכות מתמטיקה, לוגיקה והסקה מרובת שלבים על פני מקורות שונים.

לפי המדידות שלהם בשבעה מבחני DocQA כמו DocMath, Frames ו־LongBench, המודל עוקף מודלים כמו o3-mini ו־Qwen3-235B-A22B, ומשתווה לביצועים של Claude-3.7-Sonnet-Thinking. התוצאות נמדדו לפי שילוב של התאמה מדויקת ושיפוט של DeepSeek-V3 בטמפרטורה אפס, שזה אומר שההסקה שלו על טקסט מורכב אמורה להיות מדויקת מאוד ברמת הפלט הסופי.

מתאים ל

  • ניתוח דוחות כספיים

    המודל עבר אימון ייעודי על דאטה של DocMath כדי לחלץ נתונים ולבצע חישובים מספריים מתוך מאזנים ארוכים.

  • תחקור מסמכים משפטיים

    הוא אומן על הסקה לוגית מורכבת מתוך חוזים ופוליסות ומסוגל לעקוב אחרי תנאים וסעיפים רבים.

  • הצלבת מידע מכמה מקורות

    אימון על משימות Multi-Hop מאפשר לו לחבר רמזים שונים שנמצאים בחלקים מרוחקים של מסמך ענק.

איפה זה נופל

המגבלה הכי בולטת נובעת ישירות משיטת ההרחבה. המודל מוגדר במקור ל־32,768 טוקנים, וכדי להגיע לחלון המלא של 131,072 טוקנים חייבים להפעיל הרחבת YaRN בקינפוג. המפתחים עצמם מזהירים שהטמעה סטטית של YaRN עלולה לפגוע בביצועים על טקסטים קצרים, ולכן אם הקלט הממוצע שלכם קצר מ־32 אלף טוקנים, אסור להפעיל את ההרחבה הזו. בנוסף, כל המבחנים שפורסמו התמקדו במסמכים, מתמטיקה ושאלות מרובות שלבים באנגלית, כך שאין שום נתון על היכולות שלו בעברית או במשימות יצירתיות ושיחה חופשית.

שאלות
נפוצות

האם חייבים להגדיר YaRN בכל הרצה?

לא, וממש לא כדאי לעשות את זה תמיד. המפתחים מדגישים שהרחבת YaRN נחוצה רק כשעוברים את הרף של 32,768 טוקנים. אם רוב הטקסטים שלכם קצרים מזה, הפעלת ההרחבה עלולה להוריד את איכות התוצאות.

האם הוא מתאים לעבודה בעברית?

הכרטיס והאימון מתמקדים במבחנים באנגלית כמו HotpotQA ו־DocMath, ולא מדווח שום מבחן בשפות אחרות. הבסיס של Qwen2 מכיר עברית ברמה מסוימת, אבל צריך לבדוק אותו עצמאית לפני שבונים עליו לוגיקה מורכבת בעברית.

איך מריצים

כדי להריץ אותו במשקל המקורי של 61 גיגה בייט בפורמט bfloat16, צריך חומרה עם לפחות 80 גיגה בייט זיכרון גרפי, כמו כרטיס A100 או H100 בודד, וזה עוד לפני שלוקחים בחשבון את הזיכרון שדורש ה־KV cache בהקשר מלא של 131 אלף טוקנים. יש גרסת קוונטיזציה רשמית ב־AWQ של 4 ביט שמקטינה את הדרישות באופן משמעותי ומאפשרת ריצה על כרטיסים צרכניים חזקים.

אפשר להריץ אותו דרך vLLM גרסה 0.7.3 עם flash-attn, או דרך sglang ו־llama.cpp. מי שלא מחזיק שרת ייעודי ורוצה לעבד מסמכים ארוכים רק מדי פעם, יעדיף בבירור שירות ענן או API מאשר לתחזק שרת כזה יקר לבד.

from transformers import pipeline

pipe = pipeline("text-generation", model="Tongyi-Zhiwen/QwenLong-L1-32B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו בתוך מוצר פנימי או שירות בתשלום, ואפילו לארח אותו עבור לקוחות. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗