אף אחת מהדרכים הישנות לא הרגישה מהירה: מבט במסך ריק במשך 3–10 שניות בזמן שהמודל מחשב. עם SSE, כל טוקן מופיע מיידית—התפיסה משתפרת גם אם הזמן הכולל נשאר זהה. בפריסה אחת של GPT-4, הזמן עד לטוקן הראשון ירד מ-3 שניות ל-150 אלפיות השנייה; התשובה המלאה עדיין דרשה 10 שניות. במשך חמש שנים, הוספנו סטרימינג ליותר מ-30 פרויקטים—צ'אטבוטים, עוזרים עם זיכרון, ואף אחד מכלי השאילתות הפשוטים. האינטגרציות שלנו משתרעות על OpenAI, Anthropic, ומודלים עם משקלים פתוחים. סטרימינג מקצר את זמן ההמתנה הנתפס ב-80% ומפחית את נפח כרטיסי התמיכה ב-30%. מילה ראשונה מהירה מעלה את שיעורי ההמרה ב-15%.
למה SSE מתאים להעברת טוקנים
SSE הוא API דפדפן סטנדרטי—אף אחת מספריות נוספות. בניגוד ל-WebSocket, הוא חד-כיווני (משרת ללקוח) דרך HTTP, כך שהוא עובר דרך פרוקסים כמו Nginx ללא בעיות. לסטרימינג של טוקנים מ-LLM, זה מושלם: כל נתח מגיע כאירוע. אף אחת מהמורכבות של פרוטוקולים דו-כיווניים. היישום שלנו משתמש באף אחד מניתוח מותאם אישית; הדפדפן מטפל בזה באופן טבעי.







