-
Mixed-Precision Training/Inference
PAI (Platform of AI)
Alibaba Cloud Intelligence
## Outline
• TensorCore AutoCodeGen in TVM
• FP16 Mixed-Precision Training on PAI
• INT8 Inference on PAI-Blade
## TensorCore
## /1/e6f1347cd2b546040bb0c9ad6650060d/p16_2.jpg)
## FP16 Mixed-Precision Training on PAI
## Auto Mixed-Precision
PAI -name=$framework_name
-Dscript=$training_script
-DautoMixedPrecision=true
[-Dlos loss_scale_optimizer.minimize(loss)
## Loss Scaling in PAI-TF

## I NT8 Inference on PAI-Blade
## PAI-Blade

品牌展示通道
线上平台 10 万+ 流量曝光
## 深度学习应用场景
猜你喜欢

推荐请求
PAI-Rec — 推荐引擎
PAI-ABTest
A/B流量划分
BE召回/Hologres
x2i hot vec
排序
在线流程
粗排 精排 重排
PAI-EAS — 模型推理
model1
model2
推荐日志
MaxCompute
Flink
Datahub
0 码力 |
40 页 |
8.51 MB
| 2 年前 3
-
云原生 DevOps 平台 ZADIG
产品介绍
## 基本信息
## 01 公司介绍
KodeRover 是国内云原生 DevOps 领域的领军企业,帮助企业提升产研工程化水平,加速产业数字化进程,快速响应市场需求。核心团队由国内外云计算、DevOps、工程运筹学领域专家组成,已连续完成由盈动和经纬领投的天使轮/PreA 轮融资。公司旗舰产品云原生 DevOps 平台 Zadig 正成为软 正成为软件研发的新标配,软件交付领域的规则制定者,开启了软件交付 3.0 时代。
## 02 产品介绍
公司自主研发的旗舰产品 Zadig 在 GitHub 上核心开源,用平台工程支撑软件研发全生命周期,让产研高效协同,稳定迭代。Zadig 内置了 K8s YAML、Helm Chart、主机等复杂场景最佳实践,适用云原生转型/上容器云、研发效能提升、大规模微服务环境治理、研发数字化转型等应用场景,在 [Image](/uploads/documents/8/5/1/7/851750993b5bfd7d4ea618897aa14c91/p2_1.jpg)
## Zadig 理念 & 应用
## 一 体化平台帮助企业实现产研全域过程数据互通、软件质量透明、角色价值可评估
开发
数字孤岛

- 跟踪 TensorFlow 任务运行状态
- 支持分布式 TensorFlow 任务
Kubeflow
KubeFlow
## KUBEFLOW 之上
- 借力容器平台提供生产级的集群资源管理
工作区隔离与共享
数据、模型、环境、应用等
- 全面支持 AI 工作流
• 探索开发

建设测试平台,提升测试整体的吞吐量
从系统角色的角度来看,下游的生产力决定上游的生产速度。通过测试平台的建设,最终推动研发效能的提升。
持续测试的兴起与现状 持续测试的兴起与现状
MeterSphere 加速企业持续测试落地
MeterSphere 企业版及专业服务
## MeterSphere 的使命
MeterSphere 是一站式的开源持续测试平台,遵循 GPL v3 开源许可协议,涵盖测试管理、接口测试、UI 测试和性能测试等功能,全面兼容 JMeter、Selenium 等主流开源标准,有效助力开发和测试团队充分利用云弹性进行高度可扩展的自动化测试,加速高质量的软件交付。
0 码力 |
45 页 |
4.65 MB
| 2 年前 3
-
## Kubernetes日志平台建设最佳实践
## 张城-元乙
阿里巴巴
# TGO鲲鹏会
# 汇聚全球科技领导者的高端社群
全球12大城市
850+高端科技领导者
使命
Mission
为社会输送更多优秀的
科技领导者
## 愿景 Vision
构建全球领先的有技术背景
优秀人才的学习成长平台

容器、Serveless
数字化、智能化
统一日志平台
## 日志系统的重要性与建设目标
智能分析
链路跟踪
监控
数据清洗
流计算
OLAP
离线计算
线上监控

## Pivotal Greenplum $ ^{®} $
全球领先的开源MPP大数据
平台
的锁冲突
避免显式只读事务(BEGIN-SELECT-END)的两阶段提交(开发中)
fastpath锁(PostgreSQL合并)
## TPC-B基准测试:环境
基于谷歌云
平台(Google Cloud Platform, 简称GCP),为5个虚拟主机的集群,包含一个master主机和四个segment主机,master和segment虚拟主机的配置信息如下
CPU核数16 | 8 | | 内存大小(GB) | 60 | 30 |
| CPU平台 | Intel Haswell |
| 存储类型 | SSD persistent disk 0 码力 |
52 页 |
4.48 MB
| 2 年前 3 -
GO CN
基于Go构建海量作业作业平台
袁帅 villager
bilibili/基础架构部/SRE/平台工程组/资深开发工程师
作业平台简介 01
作业平台的挑战 02
B站作业平台Job的介绍 03
Job设计实现:Agent/Worker 作业执行和上报 04
Job设计实现:Scheduler 作业调度 05
Job设计实现:ApiServer 鉴权+数据处理 06
Job设计实现:其他技术难点和细节 总结展望 07
第一部分
作业平台简介
日常的运维管理无时无刻的不在执行,不管是执行软件安装、还是配置和启动服务,甚至是一个长时间的停机维护,将这些操作抽象来表达统称为作业。
运维作业的重要性在于它可以帮助运维/SRE团队更好的管理和维护系统,确保系统的稳定性和可靠性。通过自动化运维作业,可以减少人工干预,降低出错率,提高工作效率和质量
’ alt=‘OCR图片’/>
作业平台的需求来源
SALTSTACK
’ alt=‘OCR图片’/>
作业平台主要对象
作业平台主要对象
命令:一个可以独立操作,如:关机,重启等
文件分发/下载:将指定的文件分发到目标机路径;将目标机路径的文件下载到本地
作业:一系列命令、文件分发/下载的有序组合,它还包含执行对象
定时作业:定时执行的作业
’ alt=‘OCR图片’/>
第二部分
作业平台挑战
系统集成:作业平台需要集成多个系统和工具,这些系统可能来自不同的操作系统或供应商 0 码力 |
34 页 |
4.48 MB
| 3 月前 3 -
## SolarMesh 基于Istio构建的流量监管平台
## 目录
1. 为什么我们需要服务网格
2. SolarMesh的定位
3. SolarMesh的特点
4. SolarMesh对Istio社区的产品化改进
5. SolarMesh的架构
6. SolarMesh组件介绍
7. 应用场景
## 为什么我们需要服务网格 - 微服务化带来的问题
## 服务间通信的复杂性: 服务网格是一个云原生的网络基础设施,它把微服务调度中有关网络的公共能力下沉,在无任何代码侵入的情况下提供可观察性、流量管理和安全性等能力。
## SolarMesh的定位 - 基于Istio构建的流量监管平台
Istio是目前服务网格领域最流行的开源项目,38%的企业在生产中使用服务网格,其中有接近一半的选择是Istio
SolarMesh 基于 Istio 及容器技术,提供流量监控和管理,提供完善的非侵入式服务治理解决方案。 0 码力 |
20 页 |
1.29 MB
| 2 年前 3
|