稳定性的模式与反模式
稳定性之于系统,就像健康之于人类,看起来重要不紧急,然而一旦失去,就追悔莫及。
应无所住而生其心
14 篇文章
稳定性之于系统,就像健康之于人类,看起来重要不紧急,然而一旦失去,就追悔莫及。
前不久生产碰到一个故障,一台宿主机上出现了大量的丢包,对业务造成了比较大的影响,遇到的问题还是蛮值得记录下来,所以简单的整理了下。
最近一直在排查一些网络的问题,比如 connect timeout 、read timeout 以及一些丢包的问题,刚好想整理一些东西,方便和团队内及开发分享。
最近在看 eBPF 的一些材料,看到 Brendan Gregg 的博客,后面想陆续针对一些主题翻译下,这一篇主要自介绍 tcpdrop,文章比较短,原文地址
有用户反馈在dubbo的应用发布后,过几分钟之后,调用方会出现大量的connectTimeout。当时在服务端容器上进行了抓包,看到在故障期间,客户端发了syn,但是服务端没有任何响应。
其实写这种文章压力很大,因为本身自己写这种总结类文章文采真的很差,刚好昨天聊到了这个话题,我还是想把自己想的一些思考记录下来。
NSCD(name service cache daemon)是我们在linux上最常用的DNS缓存服务,它是glibc网络库的一个组件。基本上来讲我们能见到的一些编程语言和开发框架最终均会调用到glibc的网络解析的函数(如GETHOSTBYNAME or GETHOSTBYADDR等),因此绝大部分程序能够使用NS
昨天和新人交谈的时候,发现他们对网站整体的访问和架构都不清楚,所以想着可以写一篇比较白话一点的技术入门文章,内容上也可以慢慢丰富。
其实这不是8.8.8.8的问题。
最近重新拾起了异常检测这块内容,所以把skyline预定义的几个算法分析了下,总体来说代码还是比较简单和清楚的,输入是一个timeseries,输出是检测结果(True or False)。