B. Google SRE指导思想 - 拥抱风险-micklongen-ChinaUnix博客

micklongenmicklongen.blog.chinaunix.net

首页　| 　博文目录　| 　关于我

micklongen

博客访问： 1295563
博文数量： 196
博客积分： 4141
博客等级：中将
技术积分： 2253
用户组：普通用户
注册时间： 2009-03-21 20:04

文章分类

全部博文（196）

智能运维（19）

用户体验（0）

根因分析（0）

故障预测（0）

容量规划（2）

异常检测（5）

Google SRE（9）

智能运维概述（3）
系统架构（0）
人工智能（0）
测试（12）

白盒测试工具（Ja（6）

白盒测试工具（C+（6）
数据结构和算法（32）

模拟题（7）

其他（1）

博弈（4）

搜索（4）

数论（2）

图论（8）

动态规划（5）
操作系统和虚拟机（45）

Smart-VM虚拟机(（13）

Lguest源码分析（22）

FOS操作系统(本科（5）

Minix（1）

文档（4）
编译器和解释器（35）

MongoDB SQL（1）

Jack编译器（5）

nasm移植（5）

一个简单的BASIC（1）

nasm汇编器源码剖（23）
调试和调试器（14）

Dosdbg调试器分析（1）

调试器工作原理（13）
计算机网络（16）

Windows网络编程（8）

TCP/IP 协议详解（8）
搜索引擎（3）

TSE（3）
编程杂记（16）

计算机安全（2）

镜像工具开发（2）

ELF（3）

编程感悟（1）

malloc v2（3）

malloc v1（2）

函数分析（3）
其他（4）

中文编码（4）
未分配的博文（0）

文章存档

2019年（31）

2016年（1）

2014年（16）

2011年（8）

2010年（25）

2009年（115）

我的朋友

相关博文

B. Google SRE指导思想 - 拥抱风险

分类：系统运维

2019-02-22 11:11:23

B. Google SRE指导思想 - 拥抱风险
概述
目标：快速创新和高效的服务运营业务之间的风险的平衡
提升可靠性的成本
冗余的物理服务器/计算资源的成本
机会成本
度量服务的风险
基于时间的可用性
系统正常运行时间 / (系统正常运行时间 + 计划外停机时间)
合计可用性
成功请求数 / 总请求数
服务的风险容忍度
辨别消费者服务的风险容忍度
风险评估因素
需要的可用性水平
不同类型的失败对服务有不同的影响吗？
我们如何使用服务成本来帮助在风险曲线上定位这个服务
有哪些其他重要的服务指标需要考虑
等等
可用性目标
用户期望的服务水平是什么
这项服务是否直接关系到收入（我们的服务还是我们的客户的收入）
这是一个有偿服务，还是一个免费服务
如果市场上有竞争对手，那些竞争对手提供的服务水平如何
这项服务是针对消费者和企业的
等等
故障类型
给定服务的故障预期：不同类型的服务能够接受的故障不一样
成本
可量化的：直接计算，比如说广告系统
不可量化：低于背景（各种协议）误差率，基本上在0.01% ~ 1%
其他服务目标
响应延迟时间
等等
基础设施服务的风险容忍度：以Bigtable为例
概述：有多个用户，每个用户有很多不同的需求
关键战略：明确划分服务水平，从而是客户能够在构建系统时正确的风险和成本平衡
可用性目标
消费终端团队：低延时，高可靠
离线数据分析团队：高吞吐量
故障类型
低延时用户：请求队列为空
离线分析用户：队列总是满，Bigtable应该避免处于空闲状态
成本
针对不同的目标部署多套系统，比如说低延时集群和高吞吐量集群
低延时集群：资源冗余度高
高吞吐量集群：资源冗余度低
错误预算
问题：系统可靠性和产品创新速度之间的矛盾
软件对故障的容忍度：做的太少，产品脆弱无用，做的太多，失去市场机会
测试
发布频率：每一次发布都是有风险的
金丝雀测试的持续时间和大小
步骤
产品管理层定义一个SLO，确定一项服务在每个季度预计的正常运行时间
实际在线时间是通过一个中立的第三方来测算的：我们的监控系统
这两个数字的差值就是这个季度剩余的不可靠性预算
只要测算出的正常在线时间高于SLO，也就是说，只要仍然有剩余的错误预算，就可以发布新版本
好处：统一产品和SRE的目标

阅读(1721) | 评论(0) | 转发(0) |

上一篇：B. Google SRE指导思想

下一篇：C. Google SRE 实践

给主人留下些什么吧！~~

感谢所有关心和支持过ChinaUnix的朋友们

16024965号-6