GPT
מגזין · ניתוח · 5 דקות קריאה ·

הזינוק בטוקנים של AI מראה בעיקר שהסוכנים שלכם מבזבזים כסף

צריכת הטוקנים בנתבים מזנקת במאות אחוזים, אבל במקום לחגוג צמיחה כדאי שתבדקו כמה שרפתם על לולאות חשיבה תקועות.

איור של חלקיקי מידע זוהרים נעים בלולאות בתוך שעון חול
יותר טריליוני טוקנים לא בהכרח אומרים יותר ערך עסקי. איור: GPT.org.il
מה לעשות עכשיו
  • מדדו את המערכת שלכם לפי עלות לביצוע משימה מוצלחת ולא לפי נפח טוקנים גולמי, והגבילו לולאות ריצה של סוכנים לפני שהחשבון יתנפח.

גרפים של צמיחה מעריכית בדרך כלל מרגיעים משקיעים ומנהלים, עד שמסתכלים על החשבונית החודשית שיוצאת מחשבון הבנק. לפי נתונים שפרסם אתר The Decoder, צריכת הטוקנים השבועית בפלטפורמת OpenRouter זינקה ביותר מ-25,000 אחוזים מאז ינואר 2025, כשהיא מטפסת מ-0.5 טריליון ל-126.2 טריליון טוקנים בשבוע אחד בלבד בספטמבר 2026. המספר הזה נשמע מפלצתי, אבל הוא משקף את האופן שבו ארכיטקטורת התוכנה שורפת משאבי מחשוב בקצב חריג, בזמן שאימוץ משתמשי הקצה זוחל מאחור.

טוקנים הם יחידת המדידה של המודל, בערך כמו ליטרים של דלק למנוע. בעולם של סוכנים אוטונומיים, המנוע שלכם יכול לעמוד במקום, לשרוף מיכל שלם ולחשוב שהוא בדרך לחיפה.

החשבון גדל, אבל המשתמשים לא.

טוקנים של חשיבה מול ערך

מודלי הסקה מייצרים כמויות עצומות של טוקני חשיבה לפני שהם מפיקים תשובה, מה שמנפח את הספירה בצורה דרמטית.The Decoder

הפער בין מספר הטוקנים לבין ערך עסקי בפועל נעוץ במעבר למודלי חשיבה (reasoning). המודלים האלה מייצרים אלפי טוקנים מוסתרים של שרשראות מחשבה, בדיקות עצמיות ופניות פנימיות לפני שהם מחזירים משפט בודד למשתמש הקצה. כשבונים מערכת מבוססת סוכנים, כל שלב כזה מתרבה במספר הפניות שהסוכן מבצע כדי לאמת את הצעדים שלו מול כלים חיצוניים.

כשמוסיפים למשוואה הזו סוכן שרץ בלולאה לא אופטימלית, ומנסה לתקן שגיאת קוד קטנה עשרות פעמים ברצף, צריכת הטוקנים מזנקת לשמיים בלי שהמשתמש ראה ערך חדש. כל איטרציה מעבירה מחדש את כל היסטוריית השיחה המנופחת, יחד עם טוקני החשיבה שהצטברו בניסיונות הקודמים, והחיוב במונה ה-API ממשיך לדפוק. להסתכל על הגרף הזה כהוכחה להצלחה של מוצר זה פשוט עיוורון כלכלי.

כפי שכותב Matthias Bastian, עלייה קטנה בשימוש יכולה להיתרגם לזינוק ענק בצריכת טוקנים, במיוחד כאשר המערכות אינן מהודקות ברמת הקוד. הזינוק במספר הטוקנים נובע במידה רבה ממודלי חשיבה וממערכות סוכנים לא מאופטמות ששורפות משאבים בקצב מסחרר. זה נוח מאוד לספקי המחשוב, אבל הרבה פחות למי שצריך להציג רווחיות בסוף הרבעון.

סוכן אוטונומי פשוט לא עוצר לנוח.

לוח בקרה של רשת שרתים עם נקודות ניתוב עולמיות
ניתוב בין עשרות ספקים פותר עלויות, אך מייצר אתגרים בריבונות המידע. איור: GPT.org.il

מפת המודלים והעלויות

ההבדל בין המודל שמוביל בנפח התנועה לבין המודל שמייצר את ההכנסות הגבוהות ביותר מחדד את התמונה. לפי הנתונים, המודל GPT 5.6 Luna של OpenAI שלט לאחרונה בנפח הטוקנים שנצרכו בנתב. המודל מייצר כמות גדולה של טוקנים לכל פרומפט בהשוואה לאחרים, וזה לא מעיד על מספר משתמשים גבוה יותר. הוא חושב בקול רם, והמפתח משלם על כל מילה בהרהור הפנימי שלו.

בצד ההכנסות בפועל, המודל Astra של החברה הוא שמוביל את הטבלה, מה שמוכיח שעלות גבוהה ליחידה מכניסה לספקים יותר כסף מנפח גולמי של טוקנים זולים. ספקים מעדיפים להציג נתוני צריכה בטריליונים במקום נתוני הכנסה מדויקים: גרף הטוקנים עולה בחדות מעלה, בעוד שההכנסה הדולרית מתחלקת בצורה שונה לחלוטין בין מודלי פרימיום למודלי עבודה שגרתיים.

במקביל, מודלים סיניים זולים ופתוחים רושמים עלייה חדה בשימוש. ההוצאה החודשית על מודלים כמו DeepSeek, לצד Kimi ו-GLM, עלתה פי 10 מתחילת 2026. מפתחים רבים מפנים משימות רקע זולות או תפקידי ביניים לספקים הללו כדי לחסוך בהוצאות, אף שסך ההוצאה עליהם עדיין מגיע מבסיס נמוך ביחס לענקיות המערביות.

בבדיקת דף המחירים הרשמי של הנתב, אפשר לראות בבירור את פערי העלויות: סנטים בודדים למיליון טוקנים במודלים הסיניים מול מחירים מלאים במודלי העילית. מי שבונה מערכת סוכנים מורכבת מבין מהר מאוד שהרצת מודל הסקה מערבי לכל צעד קטן תרוקן את התקציב שלו בתוך ימים בודדים, ולכן התנועה נודדת לאלטרנטיבות זולות.

השוואת תנועה ועלויות בנתבי מודלים
קטגוריהמודלים לדוגמהאופי צריכת הטוקניםהכנסה מול נפחהשפעה על החשבון
מודלים מובילי נפח חסכונייםGPT 5.6 Lunaפליטה רחבה של טוקנים פר פרומפט בתמחור מוזלמוביל בנפח הטוקנים אך לא בראש ההכנסותעלויות נסתרות שמטפסות מקצב הפקת הטוקנים
מודלי דגל יקריםAstraתפוקה ממוקדת של טוקנים בעלות תמחור גבוההמוביל בהכנסות בפועל עבור הפלטפורמהתשלום גבוה פר משימה שמחייב הצדקה עסקית ישירה
מודלים פתוחים וזוליםDeepSeek, Kimi, GLMהרצה המונית של משימות רקע ועיבוד טקסט זולהוצאה חודשית שעלתה פי 10 אך נותרה נמוכה בבסיסהחיסכון ניכר בעלויות של לולאות סוכן אוטומטיות

המגבלה המקומית והרגולטורית

מפתחים מקומיים רבים שמחים לנצל נתבים גלובליים כדי להריץ שאילתות על מודלים מקומיים, כולל מודלי Jamba של AI21 Labs הישראלית, שזוכים לחיבור נוח בצינורות העבודה. עם זאת, התמונה הארגונית שונה לחלוטין. ארגונים בישראל, בדומה לחברות הפועלות תחת רגולציה בארצות הברית ובאירופה, נתקלים במחסום של ממש ברגע שמגיעים לשאלות של ריבונות נתונים ואבטחת מידע.

לפי הדוקומנטציה של פיצ'ר ה-Sovereign AI, הנתב מאפשר הגבלות ניתוב גאוגרפיות לאזורים כמו ארצות הברית או האיחוד האירופי, אך אינו מציע שרתי עיבוד בישראל. עבור גופים ביטחוניים, מוסדות פיננסיים או מערכות בריאות מקומיות שמחויבות לשמור את המידע בגבולות המדינה, ניתוב דרך צד שלישי אינו אפשרי לפי התקנות. בנוסף, העובדה שהחיוב נעשה בדולרים וללא תמיכה בהסדרי תשלום מקומיים בשקלים, מרחיקה את רוב הארגונים הגדולים לעבודה ישירה מול חוזי ענן של AWS או Azure.

נתוני הניתוב הללו מייצגים בעיקר מפתחים עצמאיים, פרויקטים צדדיים ובוני אפליקציות צ'אט רגישים למחיר. הם משקפים שכבה מצומצמת ולא את ההסכמים השנתיים של חברות ענק. חברה שמשלמת על חוזה ארגוני סגור בענן בכלל לא מופיעה בגרף הזינוק השבועי הזה, ולכן הניסיון להשליך מהנתבים על כלל השוק אינו מחזיק מים.

מי שמחויב לחוק הגנת הפרטיות הישראלי יתקשה להעביר מידע רגיש דרך שרתי פרוקסי שאינם מספקים עמידה בדרישות מקומיות. מסיבה זו, השוק הארגוני הכבד נשאר מאחורי חומות הענן הפרטיות, גם אם זה עולה לו יותר.

עמדת עבודה של מפתח עם תרשימי זרימת קוד וגרפי צריכת משאבים
לפני שמתלהבים מגרף הצמיחה של הספק, כדאי לבדוק את החשבונית החודשית. איור: GPT.org.il

איך לבדוק את הצינור

אם אתם מנהלים ארכיטקטורת סוכנים ורואים את צריכת הטוקנים שלכם מכפילה את עצמה, כדאי לעצור לפני שמזמינים שרתים נוספים. הדבר הראשון שיש לבדוק הוא מדד העלות פר משימה מוצלחת, במקום מעקב עיוור אחרי כמות הטוקנים שהסוכן פלט. אם סוכן קוד שרף הררי טוקנים כדי לתקן פסיק בבדיקת יחידה, המערכת שלכם אינה חכמה יותר, היא רק בזבזנית. לא הייתי ממהר להוסיף עוד מודלים לצינור לפני שמנקים את הלולאות הקיימות.

שנית, הגדירו תקרת קריאות קשיחה לכל לולאה עצמאית. סוכנים שנכנסים למבוי סתום נוטים לחזור על אותה פרומפט בווריאציות שונות, כשכל ניסיון כולל את כל היסטוריית השיחה הקודמת. במקרים כאלה, עדיף לחתוך את הריצה ולבקש התערבות אנושית מאשר לאפשר למודל להמשיך להסביר לעצמו למה הפונקציה נכשלת שוב ושוב. בדיקה פשוטה של הלוגים תגלה לכם מהר מאוד כמה כסף הולך על ניסיונות סרק שלעולם לא יגיעו לפתרון.

כדאי גם להפריד בין שלבי התכנון לשלבי הביצוע. אין סיבה להשתמש במודל הסקה כבד ויקר כדי לשלוף נתונים פשוטים מבסיס נתונים או לעצב טבלת HTML. ניתוב חכם למודלים קלים וזולים בשלבי הביצוע השגרתיים יחזיר את הגרף שלכם לממדים שפויים. השאירו את מודלי החשיבה הכבדים רק לצמתים שבהם נדרשת החלטה ארכיטקטונית ממשית, ולא לכל קריאת API שגרתית.

גרף שמראה עלייה של עשרות אלפי אחוזים נראה מעולה במצגות לגיוס הון, אבל בתוך מסופי הפיתוח שלכם הוא בעיקר תזכורת לכך שחישוב עולה כסף אמיתי. המודל שלכם ימשיך לחשוב כל עוד תתנו לו, ואתם אלה שתשלמו על כל שבריר שנייה של היסוס.

שאלות ותשובות

מה שואלים על זה

הנתונים מראים פער בין צריכת משאבים לבין ערך עסקי בפועל, אך הנתב מייצג בעיקר מפתחים עצמאיים ואפליקציות צד ג'. מודלי הסקה מייצרים הררי טוקנים פנימיים שמנפחים את הגרפים, מבלי שהדבר יעיד בהכרח על אימוץ ארגוני מקביל.

מודלים מסוימים, כמו GPT 5.6 Luna, עשויים לייצר כמות עצומה של טוקני חשיבה פר פרומפט בתמחור נמוך יותר, מה שמקפיץ את נפח הטוקנים. לעומת זאת, מודלים יקרים כמו Astra מפיקים פחות טוקנים אך מתומחרים גבוה יותר, ולכן מייצרים לפלטפורמה הכנסות כספיות גדולות יותר.

עבור גופים ביטחוניים, מוסדות בריאות או חברות המחויבות בריבונות מידע בישראל, השימוש בעייתי. הנתב מציע ניתוב מוגבל גאוגרפית לארה"ב ולאיחוד האירופי, אך אינו מפעיל שרתים מקומיים בישראל ואינו תומך בהסדרי תשלום בשקלים.

יש למדוד את העלות פר משימה מוצלחת ולא רק את סך הטוקנים הכללי. מומלץ להגדיר תקרת קריאות קשיחה ללולאות הרצה ולבדוק האם היסטוריית השיחה המצטברת מועברת שוב ושוב במלואה בכל ניסיון כושל של הסוכן.
מקורות
  1. OpenRouter's staggering token chart is the AI bubble debate in a single imagethe-decoder.com · המקור
  2. Sovereign AI and In-Region Routingopenrouter.ai · קריאה נוספת
  3. OpenRouter Pricing & Modelsopenrouter.ai · קריאה נוספת
  4. Matthias Bastianthe-decoder.com · מקושר מההודעה
  5. A small uptick in usage can mean a huge spike in token consumptionthe-decoder.com · מקושר מההודעה
איך בדקנו

18 עובדות בכתבה נבדקו אחת־אחת מול המקורות המקושרים ומול חיפוש ברשת ב־17 בספטמבר 2026. מה שלא אומת הוסר או מסומן כטענה של החברה. הכתיבה נעשתה בעזרת AI מהמקורות האלה בלבד, בעריכה ובאחריות של סלבה מלנדוביץ׳. טעות? כתבו לנו.

סלבה מלנדוביץ׳

מומחה בינה מלאכותית · GPT.org.il

כותב על בינה מלאכותית, מודלי שפה גדולים, אוטומציה עסקית, SEO. כל כתבה במגזין נכתבת מהמקורות הראשוניים ונבדקת מולם לפני הפרסום.