GPT
S

SmallThinker-3B-Preview

קוד פתוח

Tiinyרישיון לא דווח2024-12-12

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

מודל קומפקטי שמביא חשיבה מתמטית עמוקה למכשירים חלשים. הוא נבנה כדי לפצח בעיות מורכבות במקומות שבהם מודלי ענק פשוט לא נכנסים לזיכרון.

  • 3.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 139הורדות בחודש

מה זה

מדובר בכיוונון של Qwen2.5-3B-Instruct על דאטהסטים של שרשראות חשיבה ארוכות, כמו QWQ-LONGCOT-500K. המטרה כאן היא לא עוד מודל שיחה כללי, אלא ניסיון לדחוף יכולות הסקה מתמטית לגודל של 3.4 מיליארד פרמטרים בלבד.

במבחני ביצועים מתמטיים הוא מציג זינוק חד ביחס למודל הבסיס שלו. במבחן AIME24 הוא מגיע לציון של 16.667 לעומת 6.67 של המקור, וב־AMC23 הוא עולה מ־45 ל־57.5. המספרים האלה מראים שהוא באמת פותר בעיות חישוב והיגיון טוב יותר מרוב מה שקיים כרגע במשקל נוצה, ואפילו עוקף תוצאות מסוימות של מודלים ענקיים במבחנים ספציפיים.

מתאים ל

  • פתרון בעיות מתמטיקה מקומי

    הוא מיועד לחשיבה לוגית וחישובים במכשירים מוגבלי חומרה בלי לשלוח נתונים החוצה.

  • מודל טיוטה להאצה

    הוא משמש כטיוטה מהירה עבור QwQ-32B ב־llama.cpp ומקפיץ את קצב הייצור ל־70 טוקנים בשנייה.

  • הרצה על טלפונים ניידים

    הגודל הקטן מאפשר לפרוס אותו ישירות על מעבדי מכשירים ניידים באמצעות PowerServe.

איפה זה נופל

הכרטיס מצהיר בפירוש שהמודל אומן על אנגלית בלבד, כך שעברית ושפות אחרות פשוט לא יעבדו כאן כמו שצריך. בנוסף, יש לו בעיה מובנית במעקב אחרי הוראות עיצוב מורכבות, ובשאלות קשות במיוחד הוא נוטה להיתקע בלולאות של חזרתיות, מה שמחייב להעלות את ה־repetition penalty בזמן הדגימה.

בסיס הידע הכללי שלו צר מאוד בגלל הגודל והאימון הממוקד. אל תבנו עליו לעובדות היסטוריות או לתשובות יציבות במשימות פתוחות, הוא מועד לפליטת שטויות ברגע שיוצאים מגבולות המתמטיקה וההיגיון.

שאלות
נפוצות

האם המודל תומך בעבודה בעברית?

לא. המודל אומן על מאגרי מידע באנגלית בלבד, והיוצרים מבהירים שהיכולות שלו בשפות אחרות חסרות מאוד. לא מומלץ לבנות עליו לעיבוד או פלט בעברית.

איך מתמודדים עם הנטייה שלו לחזור על טקסט?

בגלל האימון על שרשראות חשיבה ארוכות, הוא עלול להיתקע בחזרות על אותם משפטים בבעיות קשות. הפתרון שהמפתחים מציעים בהגדרות ההרצה הוא להעלות את ערך ה־repetition penalty בזמן הקריאה למודל.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.4 גיגה-בייט בפורמט bfloat16, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בסיסי עם 8 גיגה זיכרון, או ישירות על מעבד ומכשירים ניידים בעזרת כלים כמו PowerServe. המפתחים גם קישרו מחברת Colab מוכנה להתנסות מהירה דרך transformers.

אם כל מה שאתם צריכים זה תשובות לשאלות כלליות, עדיף להשתמש ב־API זול של מודל גדול. הפורמט הזה משתלם בעיקר כשרוצים להריץ לוגיקה מקומית בלי תלות ברשת, או כשמשתמשים בו כמודל טיוטה שמאיץ שרת קיים דרך llama.cpp, שם הוא מספק קפיצה מ־40 ל־70 טוקנים בשנייה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Tiiny/SmallThinker-3B-Preview")
print(pipe("שלום"))

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. במצב כזה אין אישור משפטי מפורש לשימוש מסחרי או להפצה בתוך מוצר, ואי אפשר לדעת מה המגבלות על הקוד והמשקלים עד שהם יעדכנו רישיון רשמי.

הרישיון המלא בעמוד המודל ↗