顯示具有 hp 標籤的文章。 顯示所有文章
顯示具有 hp 標籤的文章。 顯示所有文章

2018/06/02

昨天晚上又發生ilo 當掉撈不到資料的情況
解決方法如下 reset ilo


2018/03/06

最近新進一批PC
發現影子系統上不去
測了很久
得到以下結論

影子系統無法使用在uefi 上 必須使用mbr

在PC的bios要把secure boot 關掉 不要使用uefi

要把hd的gpt分割清掉

在linux下指令
sgdisk -z /dev/sdx

否則clonezilla 無法做成image

2T以下的HD 不要使用 gpt及UEFI


2017/08/23

今天早上使用proxmox裡的guest測了一下io

host

ProLiant DL380p Gen8

raid card














guest os

linux mint 直接使用cd boot 後執行 gnome-disks 跑benchmark


datastore 使用 xfs























datastore 使用 zfs (zfs是使用由raid card做raid 5 出來之後再用 raidz0)




















是不是要為了 remote replication 而浪費這些效能
就自己決定囉

補充硬碟資料


















每台host 上共有12個如上的hd
1個hot spare 另外11個做raid 5

另外再補充在pc上測試的結果

pc上的hd資料如下
3個500G SATA 直接接在主机板上



下圖為測試結果






2017/04/20

今天中午左右
忽然一堆服務都失效
本來以為是机器當机
想不到情況更糟糕
raid card死了

























第一個想法就是把昨天晚上備份回復到另一台proxmox
當recover 做完後才想到
在正常的机器上應該有出問題那台的所有guest config
所以應該是把config 移過來
然後直接boot就好了
這樣也不會loss晚上到中午這段時間的資料
路徑在

/etc/pve/nodes/proxmox159/qemu-server
                        ^^^^^^^^^^^
                      出問題的主机名稱

在正常的机器上下指令

mv /etc/pve/nodes/proxmox159/qemu-server/* /etc/pve/qemu-server/

之後再從管理介面或下指令boot即可

操作時有可能會出現

TASK ERROR: cluster not ready – no quorum?

或無法mv的情況

因為節點之間網路的斷線,集叢中節點數量低於2時,集叢就會被鎖住

此時要下指令

pvecm expected 1

讓集叢改為只期待1個節點正常運作

這樣就可以操作了

http://blog.pulipuli.info/2014/08/proxmox-ve-fix-proxmox-ve-cluster-not.html

2017/02/21

前一陣子升級proxmox後發生一個問題
原來使用的hp storage連不上了
找了半天才發現因為proxmox新server的
initiatorname 不同了
在hp cmc上修改後連線就正常了
但連上後發現另一個問題就是裡面還殘留升級前的檔案
因為升級後已經先搬到server的肚子
所以這些檔案就變成占空間的垃圾
而且也無法從管理介面上刪除
要用指令刪除

先用 lvdisplay 找出有那些不用的image

再使用 lvremove 刪除
lvremove /dev/test/vm-121-disk-1

https://forum.proxmox.com/threads/remove-disk-images-from-lvm.10215/

2017/01/14

去年底進了三台server跟一台網路設備
接上arista 10G switch後都發現有大量的rx error







換了線 gbic 甚至再借了一台hp的10G設備來測都一樣
感覺上應該不是layer1的問題
詢問cisco 6504廠商後才知道10G已經不會去檢查封包內容 只要header正常就會直接forward
因此arista上並沒有看到任何的error
建議捉封包來看看
結果一捉發現以下的問題
















cisco 6504送出的DTP(Dynamic Trunking Protocol)封包出現checksum有問題 XD
因為目前也用不到DTP
所以建議先關了
在跟arista對接的cisco port上下指令

switchport nonegotiate

目前已經解決
第一次碰到cisco送出的封包有問題
無言

2016/10/04

之前不久proxmox上的backup出現問題

看了一下log
出現以下的訊息

Sep 13 00:01:57 proxmox78 kernel: [571754.499445] hpsa 0000:05:00.0: scsi 2:1:0:0: resetting logical  Direct-Access     HP       LOGICAL VOLUME   RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:02:08 proxmox78 kernel: [571766.276361] hpsa 0000:05:00.0: scsi 2:1:0:0: reset logical  completed successfully Direct-Access     HP       LOGICAL VOLUME   RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:05:57 proxmox78 kernel: [571994.368353] hpsa 0000:05:00.0: scsi 2:1:0:0: resetting logical  Direct-Access     HP       LOGICAL VOLUME   RAID-5 SSDSmartPathCap- En- Exp=1
Sep 13 00:06:09 proxmox78 kernel: [572007.128671] hpsa 0000:05:00.0: scsi 2:1:0:0: reset logical  completed successfully Direct-Access     HP       LOGICAL VOLUME   RAID-5 SSDSmartPathCap- En- Exp=1

再進到ilo去看後
發現以下的狀況








有HD出現smart error了
但面版上並沒有出現異常
也還是可以用
本想說應該不是出現reset的原因
但沒几天
另一台也出現同樣的問題
因為已經過保
也不打算修理
於是把其中一台關掉
把沒問題的HD拿到另一台試看看
到目前已經三週
沒有再出現問題
打電話去HP
HP回覆因為机器已經過保 無法回答問題
真是想罵人

2014/09/01

proxmox 在 hp virtual store left hand 11.0的版本下無法正常使用
更新到 11.5後目前看來是正常

隨後進行測試
二台proxmox 一開始各跑十隻guest進行i/o test
由下圖中可以看出各約1G 的流量
但在第一台再加5隻guest而第二台不變的情況下
可以看出第一台的流量增加
但第二台減少
由此可以看出storage可以提供的總流量是固定的
如下第三個圖所示











2014/05/21

簡單說明如何把新server加到原有的HP SIM

在新机器的ilo上設好ip並新加一個user
接下來在 Administration的Management裡加入 HP SIM的ip







接著login到HP SIM的管理介面
使用 選項 - 探索 - 新增一個探索









輸入新机器的ilo ip後 記得在認証裡打上ilo的user及密碼














設定後選取立即執行






如果有出現問題
再依問題進行修正 重新探索
探索完成後即可把該探索刪除或停用

昨天上架了二台新机器
可是測了一下發現 i/o的狀況如下











怎麼想都不應該差這麼多
今天早上進raid的config看了一下
原來是cache沒打開

現在的工程師
連這個都不會