昨天晚上又發生ilo 當掉撈不到資料的情況
解決方法如下 reset ilo
2018/03/06
2017/08/23
今天早上使用proxmox裡的guest測了一下io
host
ProLiant DL380p Gen8
raid card
guest os
linux mint 直接使用cd boot 後執行 gnome-disks 跑benchmark
datastore 使用 xfs
datastore 使用 zfs (zfs是使用由raid card做raid 5 出來之後再用 raidz0)
是不是要為了 remote replication 而浪費這些效能
就自己決定囉
補充硬碟資料
每台host 上共有12個如上的hd
1個hot spare 另外11個做raid 5
另外再補充在pc上測試的結果
pc上的hd資料如下
3個500G SATA 直接接在主机板上

host
ProLiant DL380p Gen8
raid card
guest os
linux mint 直接使用cd boot 後執行 gnome-disks 跑benchmark
datastore 使用 xfs
datastore 使用 zfs (zfs是使用由raid card做raid 5 出來之後再用 raidz0)
是不是要為了 remote replication 而浪費這些效能
就自己決定囉
補充硬碟資料
每台host 上共有12個如上的hd
1個hot spare 另外11個做raid 5
另外再補充在pc上測試的結果
pc上的hd資料如下
3個500G SATA 直接接在主机板上
下圖為測試結果

標籤:
benchmark,
gnome-disks,
hp,
linux,
linux mint,
proxmox,
raid,
raid card,
remote replication,
xfs,
zfs
2017/04/20
今天中午左右
忽然一堆服務都失效
本來以為是机器當机
想不到情況更糟糕
raid card死了
第一個想法就是把昨天晚上備份回復到另一台proxmox
當recover 做完後才想到
在正常的机器上應該有出問題那台的所有guest config
所以應該是把config 移過來
然後直接boot就好了
這樣也不會loss晚上到中午這段時間的資料
路徑在
/etc/pve/nodes/proxmox159/qemu-server
^^^^^^^^^^^
出問題的主机名稱
在正常的机器上下指令
mv /etc/pve/nodes/proxmox159/qemu-server/* /etc/pve/qemu-server/
之後再從管理介面或下指令boot即可
操作時有可能會出現
TASK ERROR: cluster not ready – no quorum?
或無法mv的情況
因為節點之間網路的斷線,集叢中節點數量低於2時,集叢就會被鎖住
此時要下指令
pvecm expected 1
讓集叢改為只期待1個節點正常運作
這樣就可以操作了
http://blog.pulipuli.info/2014/08/proxmox-ve-fix-proxmox-ve-cluster-not.html
忽然一堆服務都失效
本來以為是机器當机
想不到情況更糟糕
raid card死了
第一個想法就是把昨天晚上備份回復到另一台proxmox
當recover 做完後才想到
在正常的机器上應該有出問題那台的所有guest config
所以應該是把config 移過來
然後直接boot就好了
這樣也不會loss晚上到中午這段時間的資料
路徑在
/etc/pve/nodes/proxmox159/qemu-server
^^^^^^^^^^^
出問題的主机名稱
在正常的机器上下指令
mv /etc/pve/nodes/proxmox159/qemu-server/* /etc/pve/qemu-server/
之後再從管理介面或下指令boot即可
操作時有可能會出現
TASK ERROR: cluster not ready – no quorum?
或無法mv的情況
因為節點之間網路的斷線,集叢中節點數量低於2時,集叢就會被鎖住
此時要下指令
pvecm expected 1
讓集叢改為只期待1個節點正常運作
這樣就可以操作了
http://blog.pulipuli.info/2014/08/proxmox-ve-fix-proxmox-ve-cluster-not.html
2017/02/21
前一陣子升級proxmox後發生一個問題
原來使用的hp storage連不上了
找了半天才發現因為proxmox新server的
initiatorname 不同了
在hp cmc上修改後連線就正常了
但連上後發現另一個問題就是裡面還殘留升級前的檔案
因為升級後已經先搬到server的肚子
所以這些檔案就變成占空間的垃圾
而且也無法從管理介面上刪除
要用指令刪除
先用 lvdisplay 找出有那些不用的image
再使用 lvremove 刪除
lvremove /dev/test/vm-121-disk-1
https://forum.proxmox.com/threads/remove-disk-images-from-lvm.10215/
原來使用的hp storage連不上了
找了半天才發現因為proxmox新server的
initiatorname 不同了
在hp cmc上修改後連線就正常了
但連上後發現另一個問題就是裡面還殘留升級前的檔案
因為升級後已經先搬到server的肚子
所以這些檔案就變成占空間的垃圾
而且也無法從管理介面上刪除
要用指令刪除
先用 lvdisplay 找出有那些不用的image
再使用 lvremove 刪除
lvremove /dev/test/vm-121-disk-1
2017/01/14
去年底進了三台server跟一台網路設備
接上arista 10G switch後都發現有大量的rx error
換了線 gbic 甚至再借了一台hp的10G設備來測都一樣
感覺上應該不是layer1的問題
詢問cisco 6504廠商後才知道10G已經不會去檢查封包內容 只要header正常就會直接forward
因此arista上並沒有看到任何的error
建議捉封包來看看
結果一捉發現以下的問題
cisco 6504送出的DTP(Dynamic Trunking Protocol)封包出現checksum有問題 XD
因為目前也用不到DTP
所以建議先關了
在跟arista對接的cisco port上下指令
switchport nonegotiate
目前已經解決
第一次碰到cisco送出的封包有問題
無言
接上arista 10G switch後都發現有大量的rx error
換了線 gbic 甚至再借了一台hp的10G設備來測都一樣
感覺上應該不是layer1的問題
詢問cisco 6504廠商後才知道10G已經不會去檢查封包內容 只要header正常就會直接forward
因此arista上並沒有看到任何的error
建議捉封包來看看
結果一捉發現以下的問題
cisco 6504送出的DTP(Dynamic Trunking Protocol)封包出現checksum有問題 XD
因為目前也用不到DTP
所以建議先關了
在跟arista對接的cisco port上下指令
switchport nonegotiate
目前已經解決
第一次碰到cisco送出的封包有問題
無言
2016/10/04
之前不久proxmox上的backup出現問題
看了一下log
出現以下的訊息
Sep 13 00:01:57 proxmox78 kernel: [571754.499445] hpsa 0000:05:00.0: scsi 2:1:0:0: resetting logical Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:02:08 proxmox78 kernel: [571766.276361] hpsa 0000:05:00.0: scsi 2:1:0:0: reset logical completed successfully Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:05:57 proxmox78 kernel: [571994.368353] hpsa 0000:05:00.0: scsi 2:1:0:0: resetting logical Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:06:09 proxmox78 kernel: [572007.128671] hpsa 0000:05:00.0: scsi 2:1:0:0: reset logical completed successfully Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
再進到ilo去看後
發現以下的狀況
有HD出現smart error了
但面版上並沒有出現異常
也還是可以用
本想說應該不是出現reset的原因
但沒几天
另一台也出現同樣的問題
因為已經過保
也不打算修理
於是把其中一台關掉
把沒問題的HD拿到另一台試看看
到目前已經三週
沒有再出現問題
打電話去HP
HP回覆因為机器已經過保 無法回答問題
真是想罵人
看了一下log
出現以下的訊息
Sep 13 00:01:57 proxmox78 kernel: [571754.499445] hpsa 0000:05:00.0: scsi 2:1:0:0: resetting logical Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:02:08 proxmox78 kernel: [571766.276361] hpsa 0000:05:00.0: scsi 2:1:0:0: reset logical completed successfully Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:05:57 proxmox78 kernel: [571994.368353] hpsa 0000:05:00.0: scsi 2:1:0:0: resetting logical Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:06:09 proxmox78 kernel: [572007.128671] hpsa 0000:05:00.0: scsi 2:1:0:0: reset logical completed successfully Direct-Access HP LOGICAL VOLUME RAID-5 SSDSmartPathCap- En- Exp=1
再進到ilo去看後
發現以下的狀況
有HD出現smart error了
但面版上並沒有出現異常
也還是可以用
本想說應該不是出現reset的原因
但沒几天
另一台也出現同樣的問題
因為已經過保
也不打算修理
於是把其中一台關掉
把沒問題的HD拿到另一台試看看
到目前已經三週
沒有再出現問題
打電話去HP
HP回覆因為机器已經過保 無法回答問題
真是想罵人
2014/09/01
2014/05/21
訂閱:
文章 (Atom)









