网络可观测性Telemetry 网工技能升级
网络可观测性、Telemetry这些词最近在网工圈子里出现的频率越来越高,到底是什么意思?对网工来说需要学哪些新东西?今天就给大家拆解一下。
Telemetry是什么。Telemetry是Telemetry Protocol的缩写,最早在路由设备上用于实时数据采集,现在扩展到整个网络领域。它和传统的SNMP最大的区别是数据推送的实时性和数据维度的丰富性。SNMP是网管系统主动去设备上问"你现在的接口流量是多少",Telemetry是设备主动把详细的运行数据推送到采集器,包括接口计数、缓冲区状态、丢包分布、流表信息等。

Telemetry为什么这几年突然变火。驱动力主要来自三个方向。第一是网络规模变大,一个数据中心几千台设备,传统SNMP轮询的效率跟不上,Telemetry的推模式更适合大规模网络;第二是运维精细化要求提高,AI运维、自动化排障都依赖高频率、高维度的实时数据,SNMP的秒级数据已经不够用;第三是设备能力提升,新一代路由器和交换机的ASIC芯片能力足够支撑Telemetry的高频率采样。
Telemetry对网工的实际意义。第一层意义是排障能力升级,传统排障靠经验猜,现在可以基于Telemetry数据做关联分析,看到丢包、延迟、缓冲区拥塞这些细节,再结合设备日志做根因定位。第二层意义是网络规划更精准,过去扩容规划靠历史峰值估算,现在可以基于Telemetry数据做长期趋势分析,规划的准确性大幅提升。第三层意义是自动化闭环,Telemetry数据可以驱动自动化脚本做故障自愈,比如检测到某个接口持续丢包就自动触发链路切换。
网工需要学哪些新东西。第一是Telemetry的数据模型,要熟悉gNMI/OpenConfig这些标准的数据结构,能读懂采集器输出的数据格式;第二是采集器和可视化工具的搭建,Prometheus、Grafana、Telegraf这些开源工具是常见的组合,网工需要了解基本配置;第三是Python数据处理能力,Telemetry数据量很大,需要用脚本做清洗、聚合、异常检测;第四是设备端的Telemetry配置,包括采样频率、数据订阅、推送目标的设置。
学习路径建议。第一步先了解Telemetry的基本概念和传统SNMP的差异,建立整体认知;第二步在实验室里用一台路由器或交换机开启Telemetry,配合开源工具搭一个最简单的采集链路;第三步学习数据分析和可视化,把Telemetry数据接入Grafana做面板展示;第四步结合自动化工具做故障自愈的实验。
润天教育的H3CSE-RS和H3CIE-RS课程里有部分内容涉及Telemetry和数据可视化,对想升级技能栈的网工是个合适的学习起点。
总结一下,Telemetry是网工从传统运维向智能化运维升级的关键技术之一。不是所有网工都要立刻深入学习,但作为下一代网络工程师的核心技能之一,提前了解、逐步上手是有必要的。等行业全面普及再学就晚了。