GPT
S

Solar-Open2-250B-Nota-NVFP4

קוד פתוח

nota-aiother2026-07-21

  • vllm
  • safetensors
  • solar_open2
  • quantization
  • nvfp4

גרסת קוונטיזציה של 4 ביט למודל הענק של Upstage, שמצמצמת את המשקל מ־500 גיגה-בייט ל־153 גיגה-בייט. המטרה היא להריץ מודל של 145 מיליארד פרמטרים על חומרת Blackwell בלי לאבד דיוק.

  • 145Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 143 GBמשקל הקבצים
  • 12,540הורדות בחודש

מה זה

מדובר בדחיסה של Solar Open2 250B בפורמט NVFP4 שפותחה בידי Nota AI, תוך שימוש באלגוריתמים כמו DREAM-MoE ו־SRA-MoE כדי לשמור על החלטות הניתוב ברשת המומחים. הכיווץ הזה מוריד את נפח המשקלים מ־500.6 גיגה-בייט במקור ל־153.3 גיגה-בייט בלבד, כשהוא דורש חומרה שמסוגלת לחשב ב־FP4 גם למשקלים וגם לאקטיבציות.

במבחני הביצועים הירידה באיכות כמעט בלתי מורגשת. הממוצע הכללי ירד מ־81.57 נקודות בגרסת המקור ל־81.35 בקוונטיזציה, ובמבחנים מסוימים כמו LiveCodeBench או AIME 2026 באנגלית הוא אפילו רשם תוצאה מעט גבוהה יותר. המודל שומר על חלון הקשר עצום של מעל מיליון טוקנים, ותומך ביכולות חשיבה ושימוש בכלים דרך מפענחים ייעודיים של Solar Open2.

מתאים ל

  • הסקה מהירה בארגונים

    חיסכון של מעל 300 גיגה-בייט בזיכרון השרת עם שחיקה אפסית כמעט בדיוק התשובות על גבי חומרת Blackwell.

  • פיתוח קוד ופתרון בעיות

    תוצאה של 88.55 ב־LiveCodeBench מוכיחה שהדחיסה לא פגעה ביכולות התכנות וההיגיון של המודל.

  • עיבוד מסמכים ארוכים

    ניצול חלון הקשר של מיליון טוקנים עם זמן תגובה ראשוני קצר משמעותית בהשוואה לגרסה הרגילה.

איפה זה נופל

המגבלה הטכנית הקשיחה ביותר היא התלות המוחלטת בארכיטקטורת Blackwell, מה שהופך אותו ללא רלוונטי למי שמחזיק שרתי H100 או כרטיסי צרכנים. בנוסף, רשימת השפות הנתמכות מוגבלת לאנגלית, קוריאנית ויפנית, כך שאין כאן תמיכה רשמית בעברית, והתוצאות בשפה המקומית עלולות להיות נמוכות או משובשות. במבחן IFEval המודל הציג ירידה קלה מ־94.09 ל־92.61, נתון שמראה פגיעה מסוימת בדיוק בהקפדה על הוראות מורכבות.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרתי H100 או A100?

לא. הפורמט NVFP4 מבוסס על ליבות טנזור ייעודיות שקיימות רק בסדרת NVIDIA Blackwell. אם תנסו לטעון אותו על ארכיטקטורות קודמות כמו Hopper או Ampere, מנוע ההסקה לא יצליח לבצע את החישובים.

כמה ביצועים הולכים לאיבוד במעבר ל־4 ביט לעומת המקור?

האיבוד זניח לחלוטין. במבחנים שנערכו, הציון הממוצע ירד מ־81.57 ל־81.35 בלבד, כאשר במבחני מתמטיקה וקוד המודל הדחוס שמר על התוצאות ואפילו הציג עליות קלות.

איך מריצים

כדי להריץ אותו צריך חומרת NVIDIA Blackwell, למשל B200, B300 או GB200. כרטיסים ישנים יותר כמו Hopper, Ada או Ampere פשוט לא תומכים בהרצת NVFP4, ולכן אי אפשר להפעיל עליהם את הקבצים האלה כלל. ההרצה מתבצעת באמצעות vLLM עם התקנה מותאמת אישית של Upstage ושימוש ב־compressed-tensors.

במדידות של היצרן על ארבעה כרטיסי B300 SXM6 עם Tensor Parallel של 4, המודל מגיע לזמן תגובה ראשוני של 734 מילי-שניות בשיחה בודדת, ומייצר 144.5 טוקנים לשנייה. תחת עומס של 32 משתמשים במקביל הוא מציג תפוקה כוללת של מעל 1,468 טוקנים לשנייה, שזה שיפור של פי 1.45 לעומת גרסת ה־BF16 המקורית.

pip install -U huggingface_hub
hf download nota-ai/Solar-Open2-250B-Nota-NVFP4

הקבצים

42 קבצים במאגר, 143 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפיתוח כפוף לרישיון Upstage Solar License. אם אתם בונים מודל נגזר, מאמנים, מזקקים או מבצעים פיין-טיונינג, אתם מחויבים להתחיל את שם המודל בקידומת Solar, להציג באופן בולט את הכיתוב Built with Solar בכל פרסום לציבור, ולצרף עותק של הרישיון.

הרישיון המלא בעמוד המודל ↗