שילוב AI: צ'אטבוטים, RAG, חיפוש סמנטי, מערכות המלצה
ב-8 מתוך 10 פרויקטים, "צ'אטבוט AI" מתגלה כעטיפה יקרה מעל GPT-4o עם פרומפט מערכת. ללא גישה לנתונים האמיתיים של החברה. המשתמש שואל "כמה עולה תוכנית Premium?" — הבוט ממציא מחיר מהאוויר. שואל "מתי תגיע ההזמנה שלי?" — מקבל "פנה לתמיכה" בנימוס. זה לא אינטגרציה — זה חיקוי. יישמנו פתרונות RAG ביותר מ-30 פרויקטים במשך 5 שנים: מחנויות איקומרס ועד פורטלים רפואיים. אנחנו מבטיחים: סיוע AI שימושי מתחיל במקום שבו המודל קורא את המסמכים שלכם, לא תשובות כלליות.
איך אנחנו בונים מערכות RAG?
Retrieval-Augmented Generation — ארכיטקטורה סטנדרטית: שאילתה → מציאת קטעים רלוונטיים במסד נתונים וקטורי → הכנסת הקשר שנמצא → תשובת המודל. אבל השטן נמצא בפרטי היישום. בואו נפרק את המרכיבים המרכזיים שקובעים את האיכות.
חלוקה לקטעים (Chunking). חיתוך מסמך לחתיכות של 500 טוקנים ללא התחשבות במבנה הוא ערובה לאובדן משמעות. אם החיתוך נופל באמצע פסקה, ההקשר נשבר. פתרון — RecursiveCharacterTextSplitter רקורסיבי עם חפיפה של 10–15% לתיעוד. עבור חוזים והוראות, אנו משתמשים במפצל סמנטי: חילוץ כותרות, רשימות, בלוקי קוד — כל קטע הופך ליחידה עצמאית. הבדל באיכות החיפוש: בפרויקט רפואי, הדיוק עלה מ-0.55 ל-0.84 רק בזכות חלוקה נכונה.
מודל Embedding. עבור טקסטים ברוסית, intfloat/multilingual-e5-large נותן שיפור ניכר בדיוק לעומת text-embedding-ada-002 המיושן. במדידות שלנו, NDCG@10 על סט בדיקה של 10,000 זוגות שאילתה-מסמך גבוה ב-12%. text-embedding-3-large של OpenAI טוב לתוכן באנגלית, אבל לרוסית אנו ממליצים על BAAI/bge-m3 או על e5-large שהוזכר.
מסד נתונים וקטורי. אם כבר יש לכם PostgreSQL — pgvector חוסך משאבים. התקינו את ההרחבה CREATE EXTENSION vector, הוסיפו עמודה vector(1024), צרו אינדקס HNSW. בפרויקט עם 80,000 מאמרי תמיכה, זמן החיפוש p95 היה 12 אלפיות השנייה. זה מספיק. עבור קטלוגים עם מיליוני פריטים — Qdrant או Weaviate: חיפוש היברידי מקורי ו-sharding מובנים.
מה נותן חיפוש היברידי?
חיפוש וקטורי בלבד עיוור להתאמות מדויקות: מק"טים כמו "ABC-123", שמות פרטיים, ראשי תיבות הולכים לאיבוד. חיפוש טקסט מלא בלבד לא תופס מילים נרדפות וניסוחים שונים. שילוב באמצעות RRF (Reciprocal Rank Fusion) נותן את הטוב משני העולמות: BM25 + חיפוש וקטורי, תוצאות ממוזגות. בפועל, recall@20 עולה מ-0.65 ל-0.92 — ההבדל מורגש למשתמש.
Reranking — מסנן סופי: 20 המועמדים המובילים מחיפוש היברידי עוברים דרך cross-encoder/ms-marco-MiniLM-L-6-v2 מסוג cross-encoder. זה מוסיף 50–100 אלפיות השנייה לזמן התגובה, אבל הרלוונטיות משתפרת בעוד 5–10%. ללא reranking, הצ'אטבוט עלול להציג מסמכים לא רלוונטיים.
איך ליישם חיפוש סמנטי באתר?
חיפוש אחר "כורסאות עור נוחות" אמור למצוא מוצרים המתוארים כ"כסאות רכים מעור טבעי" — חיפוש LIKE רגיל לא יכול לעשות זאת. הארכיטקטורה שלנו: בעת הוספת מוצר/פוסט, נוצר אוטומטית embedding דרך multilingual-e5-large, ונשמר ב-pgvector. בשאילתה, מטמיעים עם אותו מודל, מחפשים שכנים קרובים באמצעות מרחק קוסינוס עם אינדקס HNSW. עבור קטלוג של 100,000 פריטים, האינדקס נבנה ב-3 דקות, זיכרון ~400 MB (וקטורים של 1536 ממדים). זמן חיפוש ממוצע: 20 אלפיות השנייה.
מה לגבי מערכות המלצה?
סינון שיתופי ("משתמשים כמוך קנו X") דורש היסטוריה — לפחות 2–3 חודשים של נתונים עם 1000+ משתמשים פעילים. עבור סטארטאפים או פרויקטים קטנים, אנו משתמשים בגישה מבוססת תוכן: embedding של המוצר הנוכחי → חיפוש שכנים קרובים לפי דמיון קוסינוס. כשמצטברת סטטיסטיקה מספקת (בדרך כלל 15–20 אינטראקציות למשתמש), אנו עוברים למודל היברידי LightFM. הוא משלב התנהגות ומאפייני מוצר. בפרויקט האיקומרס שלנו עם 50,000 מק"טים, המודל ההיברידי הגדיל את ההמרה בבלוק ההמלצות ב-18% (בדיקת A/B נמשכה שבועיים).
איך עובד סטרימינג?
משתמשים לא צריכים לחכות ליצירת הטקסט כולו — זה הורג את חווית המשתמש. Server-Sent Events (SSE) הוא הפרוטוקול לסטרימינג של טוקנים. ה-SDK של OpenAI תומך ב-stream: true, ומחזיר AsyncIterator. בפרונטאנד — Vercel AI SDK (useChat) או EventSource מותאם אישית. טעות אופיינית: שימוש ב-WebSocket לסטרימינג חד-כיווני — SSE פשוט יותר (פחות קוד, reconnect מובנה). סטאק: Node.js + SSE + React.
איך לתזמר סוכנים?
צ'אטבוט פשוט עונה. סוכן מבצע פעולות: יוצר טיקט ב-Jira, בודק סטטוס הזמנה ב-CRM, קובע פגישה ביומן. לתזמור אנו משתמשים ב-LangGraph: גרף מצבים שבו כל צומת הוא קריאה למודל או לכלי. useChat של Vercel AI SDK + tools עבור Next.js מאפשר הוספת אינטגרציה ב-10 שורות קוד. האתגר המרכזי — אמינות: המודל לפעמים קורא לכלי הלא נכון או מעביר פרמטרים שגויים. הגנה — סכמות Zod לכל כלי ו-structured outputs להבטחת JSON תקין.
מה כוללת העבודה?
| שלב | תוצאה | משך |
|---|---|---|
| בדיקת נתונים ולוגיקה עסקית | מפת מקורות, פורמט מסמכים, הערכת איכות | 1–2 ימים |
| אב-טיפוס של מערכת RAG או המלצות | הדגמה עם מדדים (recall, precision, latency) | 1–2 שבועות |
| אינטגרציה לאפליקציית האינטרנט הקיימת | נקודות קצה API, ממשק צ'אטבוט/חיפוש | 1–2 שבועות |
| בדיקות A/B ואופטימיזציה | דוח על מדדים (CTR, המרה, שיעור הזיות) | שבוע |
| תיעוד והדרכת צוות | מדריך תפעול, סקירת קוד | 2–3 ימים |
בנוסף: אנו מוסרים את קוד המקור של הווקטוריזר, לוחות מחוונים לניטור (Langfuse), גישה לפאנל ניהול לעדכוני מאגר ידע. תמיכה לאחר השקה — חודש חינם.
מהם לוחות הזמנים?
| משימה | זמן משוער |
|---|---|
| צ'אטבוט RAG על בסיס מאגר ידע קיים | 3–6 שבועות |
| חיפוש סמנטי בקטלוג | 2–4 שבועות |
| מערכת המלצות עם בדיקות A/B | 6–10 שבועות |
| מערכת רב-סוכנית עם אינטגרציות | החל מ-8 שבועות |
התמחור מחושב באופן אישי לאחר גילוי פרויקט. נעריך את הפרויקט שלכם תוך יום אחד. צרו קשר — נראה לכם איך להפוך AI מצעצוע לכלי שמניע רווחים.







