顯示具有 alert 標籤的文章。 顯示所有文章
顯示具有 alert 標籤的文章。 顯示所有文章

2025/10/05

又在 librenms heallth state 發現有設備fan 壞了





怪的是在syslog都沒看到相關訊息
不管是在 syslog server或在本几下 show log
所以在librenms 再加了一個alert rules





















2025/08/21

如何在librenms設定到達某個臨界值時發出告警

最快的方式

點開要設定告警的圖
找出url上的 id 值
如下所示
http://10.0.0.1/graphs/to=1755736500/id=22718/type=sensor_fanspeed/from=1755650100/

id 是 22718

再來設定 alert rule
如下圖
設定名稱, sesssor id , 跟告警值
設完後儲存即可



















第二個方式

點開要取值的圖 如下

註記表示在 alert rule 需要使用的 名稱








接下來 create new alert rule



















設定名稱, rule 即可
如果需要限定作用几器 再額外加上 match devices


建立感測器警報規則時最常會用到的選項如下

選項 (Attribute) 資料類型 說明

sensor_value            數字         (最常用) 感測器目前讀取到的數值。例如,電壓的 110、溫度的 25、電量的 98。

sensor_descr         文字         感測器的描述性名稱。例如 Input Phase 1、CPU Core 0 Temp、Toner Level。用來鎖定特定感測器。

sensor_type         文字         感測器的類型,通常來自 MIB 的定義。例如 voltage、temperature、charge、snmp。用來篩選某一類型的所有感測器。

sensor_class         文字         感測器的通用類別。與 sensor_type 類似,但更通用。例如 temperature、voltage、current 等。

sensor_limit         數字         設備本身定義的高臨界值。如果設備透過 SNMP 提供此資訊,您可以用它來做動態比較。

sensor_limit_low 數字         設備本身定義的低臨界值。

sensor_alert         數字 (0/1) 一個布林值 (Boolean),表示設備本身是否認為此感測器已處於警報狀態。1 代表是,0 代表否。


這些選項在特定情境下也可能很有用。

選項 (Attribute) 資料類型 說明

sensor_id             數字         感測器在 LibreNMS 資料庫中的唯一 ID。

sensor_prev         數字         感測器上一次輪詢 (poll) 時的數值。可用來比較數值的變化。

last_updated         時間戳         該感測器最後一次更新的時間

2024/09/17

昨天的內稽事項有提到要注意各server的HD使用量

二個做法 種 agent 或打開server的 snmp

初步的想法是打開 server的 snmp

因為現在 m$ 某些OS 預設不給ping 

所以 librenms 要改個設定值 把ping test 關了


 





撈進來後 點到 health 可以看到 cpu ram hd 的狀況



 

 



點右方的齒輪 可以在 storage processors memory 設定告警的閥值

 



 

 



 



不過這裡設完後還是不會發alert

要再手動加一條 rule 而手動加的個rule 也不會參考這裡的值 需要重新指定

 


 

2019/05/21

今天來講一下如何設定 grafana的 email alert
由於使用rpm安裝好後並沒有設定寄信的功能
所以首先要修改
/etc/grafana/grafana.ini
如下

[smtp] 
enabled = true
host = 1.2.3.4:25  改為smtp server ip
from_address = grafana@abc.com
from_name = Grafana

改好重啟
systemctl restart grafana-server

接下來在網頁介面上設定 Notification channels




































設定完成後按下 save test 檢查是否設定成功
再來就是在panel 上設定
點下panel edit 後
再點畫面左下方 alert
設定相關的值


設定完成後可以點 右上 test rule
如果沒問題
就可以在設定的情況收到通知了

2017/03/08

graylog2 announce了和splunk整合的功能
https://www.graylog.org/blog/19-graylog-splunk-integration-is-now-here
說整合也不太像 說白了就是過濾一些重要的資料再往splunk丟
因為如果是使用splunk免費版本的話一天只有500MB可以用
先由graylog2過濾的話就可省下不少的空間
利用的就是stream這個功能
不過我目前並不打算把log再丟到splunk
而且打算利用stream過濾一些異常的訊息
當發生狀況時發mail通知管理者

首先要先把發信功能打開
在graylog.conf內找到下列几行並依不同狀況進行修改

transport_email_enabled = true
transport_email_hostname = 1.2.3.4
transport_email_port = 25
transport_email_use_auth = false
transport_email_use_tls = false
transport_email_use_ssl = false
transport_email_auth_username =
transport_email_auth_password =
transport_email_subject_prefix = [graylog]
transport_email_from_email =

transport_email_web_interface_url = http://12.34.56.78

改完後重啟

接下來在web介面上操作
在stream上新增一個stream




















接下來才是重點就是要manage rules
假設我想要找認証成功的user
也就是在message裡要包含 authentication 和 success 二個關鍵字
在manage rules不能寫在一起 否則會找不到  必須要分開成二筆rule
Field使用的就是message
Type要使用contain 不建議使用 match 或其他 有時會找不到
value就使用關鍵字





















分別建立完成後就會有二筆rule
視需求是要符合全部或單一符合













設定後一定要進行測試
測試的方法就是利用我們的關鍵字進行search
得到結果後展開點一下右上方的 test against stream 選取設定的stream















測試成功會出現如下圖的訊息













再來就要設定alert了
首先新增一個alert condition 選取 stream跟condition type



















接著設定觸發的次數及相關情況及是否要重覆寄送


























再來新增一個alert notification




















接著設定要寄送的相關訊息


























最後要enable stream










設定完成後可以先寄送一封test mail

接下來如果有觸發就會收到mail了
mail並不會有完整的message內容 只是進行通知
必須要進到管理介面看