服务假死最难排查:进程还在、请求不响应。探针体系的目标是把"服务器是不是挂了"变成"哪个服务哪个环节挂了":探针覆盖脚本线程、数据库连通、缓存可用三个维度,结果进看板,告警分级推送到值班。
三个探针的检查内容、频率与超时配置。探针必须真实执行一次轻量操作,只查进程存活测不出脚本线程假死。配置如下:
[probe_list]
probe_1 = script_thread | exec_light_command | interval=60s | timeout=5s
probe_2 = database | read_health_probe | interval=60s | timeout=5s
probe_3 = cache | get_cache_probe | interval=60s | timeout=5s
[probe_rule]
fail_judge = consecutive_fail >= 3
board_color = all_ok=green, any_fail=red_on_item
探针失败的分级推送规则:单项失败推值班,多项失败升级主管并启动预案,数据库探针失败直接按 P0 处理。配置如下:
[alert_levels]
single_fail = notify_duty
multi_fail = notify_leader + start_plan
database_fail = p0_alert + sms + im_push
auto_restart = enabled_after_3_fail
restart_fail = escalate_p0
[drill]
rehearsal = monthly_disconnect_database
告警到达后的响应路径要写死:值班五分钟内认领、十五分钟内定位层级(脚本层、数据层、缓存层)、数据库 P0 直接拉群。每次真实故障后回填故障档案,探针清单随之补漏洞——探针体系是长出来的,不是一次设计出来的。
上线盯探针响应时间与失败分布:响应时间持续抬升是资源瓶颈的前兆,在探针失败之前提前扩容才是探针的价值。每月演练一次真实断库,验证告警链路与值班响应时效,演练不通过的环节限期整改。
全站技术干货持续更新:996 引擎 / Lua 实战帖,语法、参数与示例一篇讲透。进入文章地图 · 查看全部 →
设计初衷 行会系统的通病是"人多力量大"只体现在攻城:日常没有人人有份的参与结构,普通成员对行会缺少归属感与参与点。科技树把…
设计初衷 打怪掉装、强化失败、版本更替,都在往玩家背包里塞过渡装备,卖不掉、扔了心疼,压在包里发臭。回收系统的价值两条:给过…
底层原理 性能优化不靠猜,靠剖析。os.clock 返回脚本进程占用的 CPU 时间(秒,小数),两次取值之差就是中间代码的…
设计初衷 满级是长线游戏的分水岭:不转生,毕业玩家无事可做、数值通胀无处吸收;硬开新等级,老装备一夜贬值。转生系统的价值在于…
业务场景 石墓阵里 6 个精英点位驻着白野猪王,被清掉后要按周期补位。散装写法把地图、坐标、怪物名硬编码在脚本里,开新区要复…
底层原理 闭包是函数与其捕获环境的绑定:内层函数引用外层局部变量时,这份数据随函数体一起存活,外部既访问不到也改不掉。限频器…