速来报名!AICon北京站鸿蒙专场~ 了解详情
写点什么

博睿数据发布新一代统一告警平台 OneAlert:多源事件统一接入、海量告警降噪收敛

  • 2022-03-01
  • 本文字数:1787 字

    阅读完需:约 6 分钟

博睿数据发布新一代统一告警平台OneAlert:多源事件统一接入、海量告警降噪收敛

近日,博睿数据正式推出了一款多源事件统一接入、海量告警降噪收敛、故障统一管理的新一代告警平台——OneAlert。该平台可以帮助企业在构建数字化运维体系过程中,降低运维成本、提升工作效率,为业务的稳定运行保驾护航。


当前,随着企业数字化转型进程加速,企业的 IT 运行环境日趋复杂,尤其是随着信息化建设的不断深入,信息系统越来越多,各类系统越来越复杂,数据处理量也成倍的增长,极容易产生大面积事件的告警风暴。


为了快速发现自身平台故障,需要使用多个监控平台满足不同场景的监控需求,但各个平台往往互相独立,经常需要在多个平台查看和处理告警,事前发现、事中处理、事后审计都很难统计所有告警信息,使相关人员工作难度加大,导致运维管理成本较高,工作效率低下,运维人员苦不堪言。


博睿数据产品管理部高级总监孙丽在接受 InfoQ 等在内的少数几家媒体采访时表示,当前运维市场监控孤岛化现象非常严重,很多客户监控平台可能达到十几家,包括云厂商监控、容器监控、业务方监控,以及 APM、NPM、DM 厂商监控等等。未来,ITOM 的市场趋势就是统一。因此,统一事件告警平台 OneAlert 应运而生。

数字化趋势下传统 IT 运维的挑战


在数字化趋势下,传统的运维管理流程相关工具暴露了诸多问题。孙丽在接受采访时表示,当前主要存在以下三大问题:


  • 第一,现有的运维系统不是面向业务与用户体验的,而是面向于资源与应用程序的。

  • 第二,孤岛化现象非常严重。尤其是云延伸发展以后,整个环境动态化包括依赖关系特别强,企业业务已经不可观测了。现在监控其实满足不了运维需求,而是需要一个统一的可观测平台。

  • 第三,不够智能。运维工作需要投入大量的精力,如何通过人工智能的方式把运维同学的运维体验和效率提升上去,是一个需要持续思考的问题。总的来说,运维的终级状态就是智能运维,整体上人投入的精力非常低。


博睿数据认为,智能运维绝不仅局限于技术或产品,更是一种理念和策略。智能运维当以数据为基础,以监控为预警,以自动化为导向,以流程为管理,以算法为支撑,以可视化为辅助。基于此,博睿数据发布新一代统一告警平台 OneAlert,助力企业数字化转型。

统一化、规范化、智能化告警管理


据悉,OneAlert 平台是一个集告警接入、告警收敛、告警通知、告警处理、告警分析为一体的统一管理平台,产品整体架构分为事件源的采集层到接入层、存储层、处理层、展示层。



博睿数据首席架构师李骅宸在接受采访时表示,OneAlert 算法框架上层是数据输入,框架里可能有一个接口或者模块,不管是在线实时数据还是离线数据,进行数据传输,数据输入模块之下还有数据计算,主要是在线的聚合实时计算跟指标相关的一些计算技术。下层还要基于过去的日级别、月级别数据,并大量通过 Spark、Haddoop 这种大数据引擎去做一些计算,计算完之后,输出精确的 AI 算法结果的输出模块。


具体而言,OneAlert 平台主要具备以下三大能力:


1、多源事件统一接入,全方位监控覆盖


OneAlert 平台支持对主流运维监控告警源(ZABBIX、Prometheus、阿里云监控等)提供统一的事件接入功能,并对接入的多源异构数据提供标准化的映射处理功能,实现了运维异常事件的全方位监控,避免因自身监控数据相互独立导致重大事件无人发现的监控死角。


2、运维故障标准处理,提升工作效率


接入多来源的告警数据后,OneAlert 平台支持提供统一、实时的故障信息展示,运维人员不再需要登录多个平台查看故障情况,从而提升了异常事件的处理效率;同时,OneAlert 支持针对不同的通知要求选用不同的通知方式,实现将故障快速通知到相关负责人,保证故障及时响应,缩短故障处理时间,最小程度降低对业务的影响;最后,OneAlert 支持对故障进行处理跟踪,实现故障生命周期的闭环管理,使运维故障处理从以前的无序到有序流程化,提升一线运维人员、运维管理人员的整体工作效率。


3、海量告警智能收敛,降低运维成本


OneAlert 平台还支持通过告警降噪功能,对海量杂乱的异常事件进行降噪处理,大大降低了故障分析的信息量;并通过自定义标签收敛、智能 AI 收敛的功能,识别出异常事件之间的关联性,将多个关联事件归并处理成一个故障,从而辅助运维人员聚焦处理关键故障信息,避免告警风暴,极大程度降低整体运维成本。


整体来说,基于博睿数据在运维行业多年的技术积累,OneAlert 平台率先实现了对故障(事前)及时发现、统一管理;(事中)快速响应、精准处理;(事后)分析统计的全生命周期完整管控。

2022-03-01 11:352715

评论

发布
暂无评论
发现更多内容

深圳区块链DAPP程序开发未来发展简介

W13902449729

dapp开发

【网易云信】网易云信 toB 质量保障体系实践

网易智企

质量保障 PaaS平台

【kafka思考】最小成本的扩缩容副本设计方案

石臻臻的杂货铺

kafka 11月月更

MSE 结合 Dragonwell,让 Java Agent 更好用

阿里巴巴云原生

阿里云 微服务 云原生

云原生时代数据库技术趋势与场景选型

OceanBase 数据库

butterfly美化日记(一)

程序员余白

Hexo butterfly 博客配置 11月月更

探究多线程和异步

C++后台开发

多线程 后端开发 异步 linux开发 C++开发

5款宝藏办公软件,高质量打工人必备!

淋雨

OCR 办公软件 IDM

区块链DAPP开发成本差别如此之大?深圳区块链公司告诉你

W13902449729

dapp dapp开发 区块链开发

月日均AUM提升40倍!看这家银行如何做好网金客群分层经营?

索信达控股

科技 客户分群 网金客群

Java面试题解析:如何使用ReentrantLock的条件变量,让多个线程顺序执行?

千锋IT教育

复杂A/B实验如何设计?火山引擎DataTester帮你落地!

字节跳动数据平台

大数据 数据 火山引擎 A/B测试

大咖分享 | 如何构建 Alluxio 审计日志分析系统

Alluxio

分布式 Alluxio 大数据 开源 数据编排 审计日志

无脚本自动化测试

FunTester

RocketMQ 在同程旅行的落地实践

Apache RocketMQ

消息队列 Apache RocketMQ

华为阅读年度会员4折,万元好礼抢先看

叶落便知秋

管控内部威胁,数据如何安全使用?

极盾科技

数据安全

鱼传科技:函数计算,只要用上就会觉得香

阿里巴巴云原生

阿里云 云原生 函数计算

如何解决产品知识培训问题?

Baklib

最佳实践|用腾讯云AI图像能力实现AI作画

牵着蜗牛去散步

腾讯云 腾讯 AI

钉钉全栈化实践总结-前端篇

阿里技术

前端 钉钉 全栈

Hexo+Github搭建个人博客教程(二)

程序员余白

Hexo 博客搭建 11月月更

什么是入侵检测系统?有哪些分类?

wljslmz

网络安全 11月月更 入侵检测 IDS

记一次多个Java Agent同时使用的类增强冲突问题及分析

华为云开发者联盟

开发 华为云 企业号十月 PK 榜

Karmada大规模测试报告发布:突破100倍集群规模

华为云开发者联盟

云计算 云原生 华为云 企业号十月 PK 榜

“工程化”对于大型数据平台而言,意味着什么?新一届StartDT Hackathon来了

奇点云

数据平台 奇点云

文档管理系统平台:实现文档管理现代化

Baklib

Hexo框架+Github 搭建免费静态博客教程(一)

程序员余白

Hexo Github' 博客搭建 11月月更

快速实现无人车远程控制开发——实践类

阿里云AIoT

阿里云 物联网 远程控制

腾讯蓝鲸 API 网关如何借助 APISIX 实现产品升级与业务完善

API7.ai 技术团队

云原生 API网关 APISIX 客户案例

网易云信 toB 质量保障体系实践

网易云信

质量保障 PaaS平台

博睿数据发布新一代统一告警平台OneAlert:多源事件统一接入、海量告警降噪收敛_文化 & 方法_凌敏_InfoQ精选文章