GPT
Q

QwenLong-L1.5-30B-A3B

קוד פתוח

Tongyi-Zhiwenapache-2.02025-12-15

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

המודל הזה נבנה כדי להסיק מסקנות מורכבות מתוך טקסטים ארוכים במיוחד. הוא משלב מנגנון זיכרון שמטפל במידע שחורג מחלון ההקשר המקורי.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 272הורדות בחודש

מה זה

מדובר במודל שמתבסס על ארכיטקטורת MoE ופותח על בסיס Qwen3-30B-A3B-Thinking, עם התמקדות מלאה בהסקה על פני הקשר ארוך. בניגוד למודלים שמסתפקים בשליפת עובדה בודדת מתוך ים של מלל, כאן הכשירו אותו לאסוף עובדות שמפוזרות במקומות שונים במסמך ולחבר ביניהן לצורך מענה לוגי. הוא מגיע עם חלון הקשר פיזי של 262,144 טוקנים, אבל כולל גם ארכיטקטורת סוכן וניהול זיכרון כדי לעבד נפחי מידע גדולים אף יותר מזה.

המפתחים השתמשו באלגוריתם בשם AEPO כדי לייצב את הלמידה על פני רצפים ארוכים. לפי הנתונים בכרטיס, הוא משפר את מודל הבסיס שלו ב־9.9 נקודות בממוצע במבחני ביצועים של הקשר ארוך, ומציג תוצאות שמתחרות במודלים מסחריים סגורים גם במשימות של מתמטיקה, שימוש בכלים ושיחות ממושכות.

מתאים ל

  • הסקה על מסמכים מרובים

    ניתוח דוחות טכניים או מאמרים ארוכים שדורשים איסוף וחיבור נתונים ממספר מקורות שונים בבת אחת.

  • מעקב אחרי שיחות ארוכות

    הרצת סוכנים או בוטים שצריכים לזכור פרטים היסטוריים וכלים מורכבים לאורך שיחות שנמשכות זמן רב.

  • פתרון בעיות מתמטיות

    חישוב והסקה מורכבת שדורשים שלבי ביניים ארוכים בזכות אימוני החיזוק שעבר מודל הבסיס.

איפה זה נופל

הכרטיס מציג פתרון שמשלב זיכרון חיצוני מבוסס סוכן, אבל סעיף הריצה המהירה בעמוד נשאר ריק לגמרי בלי דוגמת קוד ברורה לשימוש במנגנון הזה. בנוסף, חלון הקשר ענקי מייצר עלויות חישוב וזמני תגובה איטיים מאוד בהסקה, ואין פה נתוני ביצועים או בדיקות של המודל בעברית, תחום שבו מודלים כאלה נוטים לקרטע או לצרוך הרבה יותר טוקנים מהרגיל.

שאלות
נפוצות

האם המודל תומך בעבודה מעבר ל־262,144 טוקנים?

החלון הפיזי מוגבל ל־256K, אבל המפתחים שילבו ארכיטקטורת סוכן עם מנגנון עדכון זיכרון איטרטיבי שמאפשר לו תיאורטית לעבד רצפים ארוכים יותר במקטעים.

אפשר להריץ אותו על כרטיס מסך ביתי בודד?

לא, המשקלים לבדם תופסים 56.9 גיגה בייט בפורמט bfloat16, כך שכרטיס בודד של 24 גיגה לא יספיק אפילו לטעון אותו ללא קוונטיזציה כבדה.

איך מריצים

המשקלים שוקלים קרוב ל־57 גיגה בייט בדיוק של bfloat16, כך שתצטרכו שרת עם לפחות שני כרטיסי A100 או H100 של 80 גיגה כדי להחזיק אותו בזיכרון בלי להיתקע, במיוחד כשמתחילים למלא הקשר של 256 אלף טוקנים שזולל זיכרון עבודה במהירות. הסביבה דורשת פייתון 3.10 והתקנה ייעודית של ספריית verl מגרסה 0.4 לצד transformers.

אם אין לכם תשתית חזקה זמינה, להרים את זה לבד למשימה מזדמנת זה פשוט כאב ראש יקר. שווה לפרוס אותו עצמאית רק אם אתם חייבים שהמידע העסקי הרגיש יישאר אצלכם בשרת ולא יזלוג לחברות צד שלישי.

from transformers import pipeline

pipe = pipeline("text-generation", model="Tongyi-Zhiwen/QwenLong-L1.5-30B-A3B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון חופשי לחלוטין, מתיר שימוש מסחרי, שינוי והפצה, והדרישה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗