先说个事儿:很多人把 IPS 当防火墙买了
大概三年前,一个做跨境的客户在雅加达租了半个机柜,采购了一台官方标称 IPS 吞吐 5 Gbps 的盒子,结果斋月大促当天跑到 300 Mbps 左右就开始丢包。抓包看了半天,带宽根本不是瓶颈——是开了 TLS 解密之后设备实际处理能力掉了一大截,再加上回源到新加坡的 42ms 基线延迟,TLS 握手被拖成了秒级。后来我把这台设备的测试报告翻出来,发现官方那个 5 Gbps 是 1518 字节大包、单向、无解密跑出来的。真实业务是什么流量?支付回调、Webhook、第三方 SDK 心跳,全是小包加 TLS。
这事儿之后我形成了一个很不讨厂商喜欢的习惯:任何 IPS 的 datasheet,第一行数字直接划掉不看,直接要 IMIX 混合模型的测试报告,而且要开 TLS 解密那一列。 按我这几年经手的项目,标称吞吐和真实可用吞吐之间的折损通常在 3 到 8 倍之间,出海链路因为 RTT 更长、协议更杂,基本都往 8 倍那个方向靠。你按标称值买设备,等于按体重买降落伞。
维度一:TLS 解密,出海场景真正的性能洼地
境外业务有个绕不过去的现实——你没法要求第三方支付网关、物流 API、SaaS 供应商不用 HTTPS。所以 IPS 要么不解密(那基本等于瞎),要么解密(性能腰斩再腰斩)。
这里面有几个具体参数值得盯:
- 解密算法组合:RSA 2048 握手和 ECDSA P-256 握手,在同样的硬件上性能差 3-5 倍。如果你的客户群里还有大量老安卓机(东南亚、南亚很常见),那 RSA 占比会很高,别按 ECDSA 的实验室数据做容量规划。
- 会话复用率:真实业务里 TLS session resumption 命中率能有 60%-80%,测试的时候如果没模拟这个,测出来的数字会偏悲观;但如果你的业务大量是短连接(比如独立的 Webhook 回调),复用率低于 20%,那就得按最坏情况算。
- 解密后是否回注:有些架构解密检查完要重新加密回注,这一步的额外延迟在中东到欧洲的链路上会被放大。我见过迪拜机房到法兰克福,单这一跳多出 8-12ms。
我的经验值:入门级(标称 1-2 Gbps 档)设备,开 TLS 解密后在出海业务上大概只能扛 150-400 Mbps;中端(标称 5-10 Gbps 档)大概 800 Mbps 到 1.5 Gbps。价格区间前者硬件加三年订阅大概 1.5-3 万美元,后者 5-12 万美元,年订阅费通常是硬件价的 20%-30%。这个账一定要提前算,不然第二年续费的时候财务会来找你。
维度二:签名库更新,跨境这条链路比你想的脆弱
这点很少有人提,但我在中东和非洲的项目上被坑过两次。
IPS 的价值在于签名库够新,但签名库要回传到厂商的云端做沙箱分析。如果你在拉各斯或者雅加达,回传到美国或欧洲的云节点,单次往返 200ms 起步,遇到海底光缆抖动直接超时。结果就是:签名延迟从正常的几小时变成一两天,而这恰恰是 0day 攻击最关键的窗口期。
几个可以量化的指标,采购前一定要问清楚:
- 签名下发节点的地理分布——东南亚有没有 POP,中东有没有,非洲呢?
- 签名包的体积和下发频率——有的厂商是全量包每几小时推一次,几百 MB,跨境链路上很痛;有的是增量包,几十 KB。
- 沙箱分析的默认上传策略——是自动上传可疑文件,还是手动?自动上传在 GDPR 场景下会有麻烦,这事后面说。
顺便说一句,国内厂商在这块反而有优势,因为他们在东南亚、中东的节点铺得比很多人想象中要早。当然签名库的覆盖广度是另一回事,这个得看你业务实际面临什么威胁。
维度三:出海业务被误报搞挂的次数,远多于被真攻击搞挂
这是我个人最想说的一个反常识结论。
大家买 IPS 的默认假设是「漏报最可怕」,但出海业务的真实情况是:一次误报把支付回调拦掉,损失是分钟级的真金白银;而漏报导致的损失,对绝大多数中小出海企业来说,期望值远低于误报。
我统计过手上五六个项目,过去两年触发过的真实安全事件里,需要 IPS 拦截的比例不到 15%,其余都是账号侧、配置侧、供应链侧的问题。但误报导致的工单,平均每个项目每月 2-4 次,其中一次直接把一个印尼本地钱包的支付回调拦了 40 分钟。
所以选型的时候,除了看拦截率,更要看这几个东西:
- 误报抑制机制:能不能基于业务基线自动学习?学习周期多久?有的设备要跑满 7 天才收敛。
- 例外规则的粒度:能不能按 URL 路径、按源 IP 段、按 HTTP Header 做例外?只能按签名 ID 关的那种,基本没法用。
- 灰度/仅告警模式:上线初期必须是 tap 模式或者仅告警,跑够两周再切阻断。这个流程要写进上线文档,别嫌麻烦。
维度四:合规,尤其是数据驻留这一条
出海绕不开本地法规。几个具体的:
- 印尼 PDP Law:个人数据出境有约束,IPS 如果自动把含个人数据的可疑文件上传到境外沙箱,理论上是有风险的。
- GDPR 第 32 条:要求采取适当的技术措施,IPS 算一个,但日志留存和访问控制要能说清楚。
- PCI DSS 4.0:涉及支付卡的业务,6.4.2 和 11.5 这两条对边界防护和变更检测有明确要求,IPS 的策略变更要走变更管理流程。
实操上,我会建议:日志本地留存至少 90 天(很多法规要求 6 个月到 1 年,但 90 天是运维上比较舒服的起点),沙箱上传改成手动或者只上传脱敏后的元数据,设备的配置变更和签名版本要有审计记录。这些事不难,但一定要在上线前做,事后补很痛苦。
落地步骤,按我这个顺序来
- 先做流量画像:抓 72 小时真实流量,统计包大小分布、TLS 版本和加密套件占比、会话复用率、峰值 PPS。这一步不做,后面全是猜。
- 按真实吞吐的 1.5 倍选容量:不是按标称,是按 IMIX + 开解密的实测值再乘 1.5。
- tap 模式跑两周:只告警不阻断,统计误报。
- 建例外规则库:把支付、登录、Webhook 这几类路径单独拉出来,配细粒度例外。
- 灰度切阻断:先切非核心业务,观察一周。
- 月度复盘:签名更新延迟、误报数、性能水位,三个数一起看。
最后一句可能不太中听:很多出海团队其实根本不需要一台独立的硬件 IPS。如果业务主要跑在云上,云厂商原生的网络防火墙加上 WAF,配合好的日志和告警,覆盖度能到七八成,成本还低。硬件 IPS 更适合那些有本地 IDC、有等保或合规硬要求、或者业务延迟极端敏感的场景。别为了买个安心而买,那玩意儿的续费账单每年都会提醒你。