לפעמים תקרית נותרת ללא טיפול בזמן שמהנדס התורן אינו מגיב — והעסק מפסיד כסף. אנו מגדירים את OpsGenie כך שהתראה תגיע למהנדס הנכון תוך שניות, והסלמה תופעל אוטומטית. אנו עובדים עם OpsGenie כבר למעלה מ-5 שנים ופרסנו אותו ביותר מ-30 פרויקטים. תצורה נכונה מפחיתה את ה-MTTR ב-40% — מאומת על ידי נתונים מהפרויקטים שלנו. עבור צוותי DevOps, זהו הסטנדרט. קבלו ייעוץ להגדרת OpsGenie עבור התשתית שלכם.
למה לבחור ב-OpsGenie לניהול תקלות?
OpsGenie (Atlassian) היא חלופה ל-PagerDuty עם תמחור גמיש ואינטגרציה מובנית עם Jira ו-Confluence. עבור צוותים שכבר משתמשים ב-Jira Service Management Advanced או Premium, OpsGenie כלולה ללא עלות נוספת. הפתרון מפחית את ה-MTTR באמצעות ניתוב אוטומטי והסלמה רב-שלבית. לפי מדדים, OpsGenie מספקת התראות פי 3 מהר יותר ממערכות קוד פתוח, ומעבדת עד 1,000 התראות בדקה ללא עיכובים. היא מקצרת את זמן התגובה לתקלות ב-50%.
מושגי מפתח ותצורה
- צוותים — קבוצות של מהנדסים שאליהן מנותבות ההתראות.
- לוחות זמנים לתורנות — סבבי תורנות עם החלפות וחריגים זמניים.
- מדיניות הסלמה — רצף הודעות כאשר המהנדס הראשי אינו מגיב.
- כללי ניתוב — ניתוב מותנה לפי תגיות, מקור, שעה ביום.
- מדיניות התראות — כללי טרנספורמציה: דיכוי אזעקות שווא, סגירה אוטומטית, ניתוב מחדש.
כיצד להגדיר ניתוב התראות חכם
כללי ניתוב מכוונים התראות לפי הקשר. דוגמה לכלל:
- אם alert.tags מכיל "payment" ו- time = business_hours → נתב לצוות תשלומים, הסלמה payment-escalation.
- אם alert.tags מכיל "payment" ו- time = off_hours → נתב ל-on-call-primary, הסלמה critical-escalation.
- אם alert.priority = "P5" → צור כרטיס בלבד, ללא הודעה.
חיבור מקורות התראות
Prometheus Alertmanager
receivers:
- name: 'opsgenie'
opsgenie_configs:
- api_key: '<OPSGENIE_API_KEY>'
message: '{{ .CommonAnnotations.summary }}'
description: '{{ .CommonAnnotations.description }}'
priority: |
{{- if eq .CommonLabels.severity "critical" -}}P1
{{- else if eq .CommonLabels.severity "warning" -}}P3
{{- else -}}P5{{- end -}}
tags: '{{ .CommonLabels.alertname }},{{ .CommonLabels.cluster }}'Grafana → OpsGenie: בערוץ ההתראות של Grafana, בחרו OpsGenie והזינו מפתח API. ההודעות כוללות צילום מסך של הפאנל.
Webhook מותאם אישית (מכל מקור):
curl -X POST https://api.opsgenie.com/v2/alerts \
-H "Authorization: GenieKey $API_KEY" \
-H "Content-Type: application/json" \
-d '{ "message": "High error rate on payment service", "alias": "payment-high-error-rate", "priority": "P1", "tags": ["payment", "production"], "details": {"error_rate": "5.2%", "threshold": "1%"} }' ניטור Heartbeat וחלונות תחזוקה
Heartbeats עוקבים אחר תהליכים סדירים (משימות cron, משימות אצווה). אם תהליך לא שולח heartbeat בתוך הזמן הצפוי, מופעלת התראה. דוגמה לסקריפט Python:
import requests
def send_heartbeat(heartbeat_name: str):
requests.get(
f"https://api.opsgenie.com/v2/heartbeats/{heartbeat_name}/ping",
headers={"Authorization": f"GenieKey {API_KEY}"}
)תצורה: תקופה של שעה, תקופת חסד של 10 דקות. אם ה-cron לא שולח אות במשך 70 דקות, נשלחת התראה למהנדס התורן.
חלונות תחזוקה מדכאים התראות במהלך עבודה מתוכננת. דוגמה לקריאת API:
import requests, datetime
def create_maintenance(name: str, start: datetime, end: datetime, services: list):
requests.post(
"https://api.opsgenie.com/v1/maintenance",
headers={"Authorization": f"GenieKey {API_KEY}"},
json={
"description": name,
"time": {
"type": "schedule",
"startDate": start.isoformat(),
"endDate": end.isoformat()
},
"rules": [{"state": "disabled", "entity": {"id": s, "type": "service"}} for s in services]
}
) אינטגרציה עם Jira Service Management ו-Jira Software
בתוכניות JSM Advanced/Premium, OpsGenie מובנית. התראה ב-OpsGenie יוצרת אוטומטית בעיה ב-JSM; כאשר היא נפתרת, הבעיה נסגרת. סנכרון דו-כיווני שומר על תגובות וסטטוס מעודכנים בשני הכלים.
עבור Jira עצמאי (Software): אינטגרציית OpsGenie → Jira יוצרת כרטיס בעת תקרית, ממפה חומרה לעדיפות ב-Jira, ומקצה את המהנדס התורן.
מקרה אמיתי: הפחתת MTTR לחברת פינטק
לקוח פינטק המעבד למעלה ממיליון עסקאות ביום התמודד עם זמני תגובה איטיים לתקלות — התראות קריטיות על תשלומים הגיעו לעיתים עד 12 דקות למהנדס הנכון. הגדרנו OpsGenie עם ניתוב חכם לפי תגיות עסקה וחומרה, בשילוב הסלמה רב-שלבית (תורן → משני → ראש צוות). לאחר התצורה, התראות הגיעו למהנדס התורן תוך שניות, וה-MTTR הממוצע ירד ל-3 דקות — שיפור של 75%. הלקוח מטפל כעת בעד 500 התראות ביום ללא עיכובים.
מה כולל שילוב OpsGenie
| רכיב | תיאור |
|---|---|
| תצורת צוותים ולוחות זמנים | יצירת צוותים, לוחות תורנות, מדיניות הסלמה |
| חיבור ניטור | הגדרת אינטגרציות עם Prometheus, Grafana, CloudWatch ועוד |
| כללי ניתוב + מדיניות התראות | ניתוב מותנה ופעולות אוטומטיות |
| Heartbeat + חלונות תחזוקה | ניטור משימות cron ודיכוי התראות במהלך עבודה מתוכננת |
| אינטגרציית Jira | סנכרון תקלות דו-כיווני |
| תיעוד והדרכה | העברת ידע לצוות שלכם |
תהליך ולוח זמנים
- ניתוח: סקירת תהליכי הניטור והתגובה לתקלות הקיימים.
- עיצוב: פיתוח תוכנית ניתוב והסלמה.
- יישום: הגדרת OpsGenie, חיבור מקורות התראות.
- בדיקות: אימות תרחישים: התראה → הודעה → הסלמה → פתרון.
- פריסה: עלייה לאוויר, העברת תיעוד.
| שלב | משך |
|---|---|
| הגדרה בסיסית (צוותים + לוחות זמנים + הסלמה) | יום אחד |
| חיבור ניטור (Prometheus, Grafana, CloudWatch) | יום אחד |
| כללי ניתוב + מדיניות התראות | יום אחד |
| Heartbeats + חלונות תחזוקה | חצי יום |
| אינטגרציית Jira | חצי יום עד יום |
| תיעוד והדרכה | חצי יום |
לוח זמנים כולל: בין 4 ל-5 ימי עבודה, תלוי במורכבות התשתית. עם תצורת OpsGenie אפקטיבית, ניתן להפחית את זמן התגובה לתקלות ב-50% (נתוני פרויקטים).
קבלו ייעוץ והצעה מסחרית תוך יום אחד.
דוגמה לתצורת הסלמה
escalation:
name: Critical Escalation
rules:
- condition: "P1"
notify:
- after: 0m
target: on-call-primary
- after: 5m
target: on-call-secondary
- after: 10m
target: team-lead
repeat: 3







