服务器管理员

系统和网络管理员的问答

2
Ext4的用法和性能
我有一堆运行Carbon和Graphite的机器,需要扩展以增加存储量,但是我不确定是否需要扩展或扩展。 该集群当前包括: 1个中继节点:接收所有指标并转发到相关的存储节点 6个存储节点:容纳所有Whisper DB文件 问题是,当磁盘使用率接近80%时,性能似乎会下降。群集写入IOPS从近乎恒定的13k下降到更混乱的约7k的平均值,而IOwait时间的平均值为54%。 我浏览了我们的配置库,自4月初以来没有任何更改,因此这不是配置更改的结果。 问题:增加磁盘大小是否会使IO性能重新得到控制,还是需要添加更多存储节点? 注意:这里没有SSD,只有很多主轴。 相关图: 统计资料: e2freefrag: [root@graphite-storage-01 ~]# e2freefrag /dev/vda3 Device: /dev/vda3 Blocksize: 4096 bytes Total blocks: 9961176 Free blocks: 4781849 (48.0%) Min. free extent: 4 KB Max. free extent: 81308 KB Avg. free extent: 284 KB Num. free extent: 19071 HISTOGRAM OF FREE …

3
尽管使用了ntp,我的交换机之一怎么会关闭两分钟?
我只是偶然地发现我的一台Cisco 4500交换机的时钟有问题:尽管ntp功能正常,但它仍然落后2分钟以上。我认为,所涉及的系统即使是一秒钟也不应被接受。另外,如果不将其与简单的挂钟进行比较,我将不会注意到与诊断程序的区别。 一些细节 这是我的某些主机(10.0.99.1、10.0.99.2、10.0.1.119、10.0.99.241)的ntp信息,这些主机部分相互引用以进行回退,但最终最终应该全部与10.0.0.1同步,从而再次拉回时间从外面。因此,时间差异不能源于不同的原始时间源。由于观察结果使我有些偏执,因此“具有正确的时间”的含义如下show clock:(或date)产生了与我的壁钟和本地系统时钟(根据http://time.is可以的)匹配的输出错误肯定在1秒以下(我在观看本地时钟时按ENTER的准确性) 10.0.1.119(Ubuntu)的时间正确 $ ntpq -np remote refid st t when poll reach delay offset jitter ============================================================================== +10.0.99.1 10.0.0.1 3 u 855 1024 377 0.904 -2.658 0.113 *10.0.0.1 130.149.17.8 2 u 266 1024 377 0.253 0.909 0.127 10.0.99.241(Cisco 2960)的时间正确 #sho ntp associations address ref clock st when …

3
SSL证书如何仅适用于某些客户端?
我的托管服务提供商最近为我的域重新颁发了SSL证书,并重新安装了SSL证书,因为这些证书让旧的证书误过期了。 现在,我可以再次通过HTTPS 浏览该网站,我的主机也可以,其他许多用户也可以。 但是,某些用户(至少数百个用户中的至少十二个)仍在Your connection is not secure不同的浏览器和平台上收到错误消息。(事实证明,很难诊断出我无法复制的问题。) 我了解不同的浏览器使用不同的证书颁发机构(CA)列表。 如果我没有运行相同版本的Firefox(在OS X上为45.0.1),却出现SEC_ERROR_UNKNOWN_ISSUER错误(仅适用于我的网站),为什么?有什么可能呢?该用户清除了缓存并重新启动了笔记本电脑。 我在digicert.com上运行了SSL检查。结果是这样的: SSL证书不受信任 证书不是由受信任的机构签名的(请检查Mozilla的根存储)。如果您是从受信任的机构购买的证书,则可能只需要安装一个或多个中间证书。请与证书提供商联系,以获取针对您的服务器平台的帮助。 在这种情况下,我怎么能在没有SSL错误的情况下连接到站点?

4
监视VMware ESXi 5.5服务器上的DELL硬件
尽管在网上大量研究了这个主题(公平地讲,我不是一个专职的sysadmin),但我无法弄清楚。 我们有一堆VMWare ESXi 5.5服务器,其中有些已集成到vSphere中,而有些则没有(出于成本原因)。 除了一台实际运行DELL VMWare ESXi映像的机器外,所有其他程序都运行标准ESXi映像。 我想完成的事情看起来很简单:配置系统,以便可以从远程主机通过SNMP查询它,无论是snmpwalk,Nagios,PRTG等。我想查看来自温度传感器,已安装磁盘及其状态的信息。 ,风扇速度,PSU状态等。 我的印象是,从DELL安装VMWare版本将自动启用必要的模块(最重要的是OpenManage),但事实并非如此。 我是否有完全冲突的信息,甚至根本不可能,一些文档说您无法通过SNMP查询DELL VMWare ESXi服务器,并且需要使用CIM客户端。然后是一个可以安装的OMSA VIB,等等。 我认为这是一个相当普遍的要求,但可用的文档却在各个不同的方面都提出了要求。 我尝试做的事情是否可能(在没有完整的vSphere环境的情况下)可行?

3
/ etc / hosts的大小限制(Linux)
在您可能开始发现性能下降之前,是否有人碰巧知道Linux系统上/ etc / hosts的理论大小限制? 此外,有人可以指出某些预期限制的官方消息吗?
11 linux  hosts 

2
如何确定系统是由于局域网唤醒(WoL)还是由于电源按钮而启动的?
在Windows 10中,我想知道如何在脚本中告诉系统是因为接收到局域网唤醒(WoL)数据包而打开系统,还是由于按下电源按钮而打开了系统而引导的。 我确实找到了Win32_ComputerSystem类的WakeUpType属性。记录该文件是为了返回“导致系统启动的事件”。有9种可能的返回值,其中之一是“ 5”(表示“ LAN远程”)。 不幸的是,在我的系统上,它似乎总是返回“ 6”(表示“电源开关”): PS C:\WINDOWS\system32> echo $(Get-WmiObject -class win32_computersystem).wakeuptype 6 我注意到,在使系统进入睡眠状态并使用WoL唤醒系统之后,Windows在系统事件日志中发布了一个事件,该事件的来源为“ Power-Troubleshooter”,事件ID为1,其中包含以下文本: 唤醒源:设备-Intel(R)82579V千兆网络连接 另外,powercfg /lastwake将NIC报告为唤醒原因。因此,即使在这种情况下,即使WakeUpType属性仍返回“ 6”(电源开关),Windows至少也可以确定由于WoL数据包而将其唤醒。 不幸的是,当系统接收到处于S5状态的WoL数据包时,它将正常启动并引导,但是我不能说它是由于WoL而引导的。powercfg /lastwake显示与由于按下电源按钮而从S5上电时的输出完全相同的输出: C:\WINDOWS\system32>powercfg /lastwake Wake History Count - 0 在任何电源状态(最高S5)下,我如何可靠地判断系统由于WoL开机/唤醒?

2
如果后端关闭,nginx使用代理缓存
如果后端服务器关闭,我需要nginx代理使用缓存: 这是我的配置。但似乎是nginx使用不带检查后端服务器的缓存。 http { # ... proxy_set_header Host $host; proxy_set_header X-Real-IP $remote_addr; proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for; proxy_cache_path /tmp/nginx levels=1:2 keys_zone=tmpzone:10m inactive=60m; proxy_cache_key "$scheme$request_method$host$request_uri"; server { server_name _; location / { proxy_connect_timeout 5s; proxy_read_timeout 5s; proxy_cache tmpzone; proxy_cache_valid 200 304 1d; proxy_cache_use_stale error timeout invalid_header updating http_500 http_502 http_503 http_504; proxy_set_header X-Real-IP …
11 nginx  proxy  cache  failover 

2
要求DNS服务器响应未知域请求的RFC
我的域名注册商和DNS提供当前忽略对未知域的DNS请求。忽略是指出现黑洞且从不响应,这会导致我的DNS客户端和解析器库重试,退出并最终超时。 dig @NS3.DNSOWL.COM somedomainthatdoesntexist.org ... ;; connection timed out; no servers could be reached 在调查其他流行的域名服务时,我看到此行为非常独特,因为其他提供程序返回的RCODE为5(拒绝): dig @DNS1.NAME-SERVICES.COM somedomainthatdoesntexist.org dig @NS-284.AWSDNS-35.COM somedomainthatdoesntexist.org dig @NS21.DOMAINCONTROL.COM somedomainthatdoesntexist.org 全部返回如下内容: ;; ->>HEADER<<- opcode: QUERY, status: REFUSED, id: 64732 要么 ;; ->>HEADER<<- opcode: QUERY, status: NXDOMAIN, id: 31219 恕我直言,立即返回REFUSED或NXDOMAIN立即发送,而不是仅将请求丢弃在服务器机房地板上。 当我向提供者投诉他们的服务器没有响应时,他们要求我引用他们的服务器违反的RFC。我知道奇怪的是,他们要我证明他们的服务器应该响应所有请求,但事实并非如此。 问题: 我的规定是,除非存在重复的请求ID或某种DOS响应,否则服务器应始终响应该请求。这个对吗? 我应该引用什么RFC和特定部分来支持我的规定? 对我来说,不响应DNS查询是很糟糕的。大多数客户端将退出,然后将同一查询重新传输到同一DNS服务器或另一台服务器。它们不仅减慢了客户端的速度,而且还导致它们自己或其他服务器根据权威名称服务器和NS条目再次执行相同的查询。 在RFC 1536和2308中,出于性能原因,我看到了很多有关否定缓存的信息,并停止了重新传输同一查询。在4074中,我看到有关返回RCODE为0的空答案的信息,因此客户端知道没有ipv6信息,该信息会导致客户端询问A …


5
测试服务器服务特定域的能力
假设您已经Server A设置了自己喜欢的webserver-daemon服务www.example.com。现在,您要将其移至Server B。经过大量复制和配置后,新服务器似乎已准备就绪。最终测试将按顺序进行:在更改DNS记录之前,www.example.com当DNS记录仍指向服务器A时,如何从服务器B请求? 虽然我的主要问题已得到回答,但是如果/ etc / hosts不受我的影响,是否可以通过telnet来测试它而不是将原始HTTP1.1与Web服务器通信?

2
为什么Linux内核没有关闭FIN_WAIT2状态的连接?
我有一个叫长寿命过程中的问题KUBE-代理的存在部分Kubernetes。 问题是,连接有时不处于FIN_WAIT2状态。 $ sudo netstat -tpn | grep FIN_WAIT2 tcp6 0 0 10.244.0.1:33132 10.244.0.35:48936 FIN_WAIT2 14125/kube-proxy tcp6 0 0 10.244.0.1:48340 10.244.0.35:56339 FIN_WAIT2 14125/kube-proxy tcp6 0 0 10.244.0.1:52619 10.244.0.35:57859 FIN_WAIT2 14125/kube-proxy tcp6 0 0 10.244.0.1:33132 10.244.0.50:36466 FIN_WAIT2 14125/kube-proxy 这些连接会随着时间的推移而堆积,从而导致过程异常。我已经向Kubernetes错误跟踪器报告了一个问题,但是我想了解为什么Linux内核没有关闭这种连接。 根据其文档(搜索tcp_fin_timeout),处于FIN_WAIT2状态的连接应在X秒钟后由内核关闭,其中可以从/ proc读取X。在我的机器上,它设置为60: $ cat /proc/sys/net/ipv4/tcp_fin_timeout 60 因此,如果我理解正确,则此类连接应在60秒内关闭。但是事实并非如此,它们会处于这种状态数小时。 虽然我也知道FIN_WAIT2连接是非常不寻常的(这意味着主机正在等待连接的远程端可能已经消失的ACK),但我不明白为什么这些连接不会被系统“关闭” 。 有什么我可以做的吗? 请注意,重启相关过程是万不得已的方法。

2
crontab发送长达一个月的电子邮件
ubuntu 14.04 Mailserver:Postfix root接收来自crontab的数十封电子邮件。这些邮件包含PHP警告。 我已经解决了这些警告的原因。 我已修复每个cronjobs不发送电子邮件(输出发送到>/dev/null 2>&1)的问题 我已经删除了以前的所有电子邮件 / var / mail / root / var / spool / mail / root 但是我仍然每小时收到数十封电子邮件。这些电子邮件来自cronjobs,有时已有近一个月的历史了。 我不明白:这些电子邮件来自何处,又存储在哪里?

4
通过WAN运行终端服务器(RDS)的延迟阈值是多少?
我已经看到:高延迟链接上的终端服务器性能 但是我有一个客户有兴趣将他们的系统基础架构迁移到距其总部约62ms延迟的数据中心。 该环境由三个Windows Server 2008 R2 RDS服务器,文件和打印服务以及Microsoft Exchange 2010组成。所有这些当前都在vSphere 5.5群集上进行了虚拟化。目前共有80位用户使用HP瘦客户端本地连接到RDS系统。 由于设施问题以及异地和远程用户的增加,存在将系统移至数据中心设施的推动。新站点将具有高端vSphere主机和全闪存存储。 将通过具有多个ISP的站点到站点VPN并建立故障转移,来建立与托管服务器的连接。 不过,这是个坏主意吗?我经常连接到此站点,以通过RDP和SSH进行维护工作,对于我的用例来说,性能是可以接受的。用户正在使用基本的MS Office套件和几个基于SSH终端的轻量级 ERP应用程序。 62ms对于这种类型的用户负载和Microsoft RDS是否合理?

1
Windows Server与Windows桌面的优化方式有何不同?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,以使其成为服务器故障的主题。 4年前关闭。 我大部分看到的所有答案都只是说“服务器已优化为服务器,桌面已优化为桌面”,没有任何技术细节说明如何以及在何处应用这些优化。 他们应该运行相同的内核吗?因此,如果我们排除运行在操作系统之上的软件(显然,整个企业软件堆栈仅在服务器上运行),那么两个操作系统之间的柚木和优化之间有什么区别? 这个问题在这里被更广泛地提出。公认的答案指出了这两种操作系统之间的这些差异:支持的内存和处理器数量,支持的软件和服务,支持的连接(尽管可以修改),以及“服务器OS配置为优先考虑后台应用程序/服务和客户端操作系统配置为优先给前台应用程序”。 我找不到任何说明服务器如何优先处理后台服务的文档,或者是否对网络堆栈或操作系统的其他低层组件进行了其他调整。 是否有任何文档以特定的技术术语描述了任何优化/内核调整?

1
尽管后端服务正常,但Google Cloud http负载均衡器仍返回502
我已经配置了一个GCE http(s)负载均衡器,以将流量定向到2个后端:-默认后端-另一个具有单独的主机/路径规则的后端(<host>:/*) 两个后端都存在于同一实例组上-运行两个公开不同NodePort的kubernetes服务的容器集群。 实例组具有两个命名端口,每个公开的NodePort都一个。 尽管两个后端都报告运行状况良好,但是对第二后端的所有请求都返回502。 服务本身不是问题-如果我将服务切换到默认的第二后端,则可以正常工作。 注意:自首次发布以来,我已经对该说明进行了相当大的更新/简化,因为我可以用更简单的配置重现该问题。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.