使用Gateway with Inference Extension实现推理请求排队与优先级调度
Gateway with Inference Extension支持基于推理服务负载感知的推理请求排队与优先级调度。当生成式AI推理服务后端模型服务器满载时,可以根据模型优先级对队列中的推理请求进行优先级调度,即优先响应高优先级模型的请求。本文主要介绍Gateway with Inference Extension的推理请求排队与优先级调度能力。
在ACK Auto Mode集群中部署工作负载并实现负载均衡
本文介绍如何在ACK Auto Mode集群中部署一个工作负载,并通过ALB Ingress实现公网访问。完成后,您可以通过设定的域名访问该应用,实现外部流量的高效管理和负载均衡。
为LLM推理服务配置推理网关智能路由
传统的HTTP请求,经典负载均衡算法可以将请求均匀地发送给不同的工作负载。然而,对于LLM推理服务来说,每个请求给后端带来的负载是难以预测的。推理网关(Gateway with Inference Extension)是基于Kubernetes社区Gateway API及其Inference Extension规范实现的增强型组件,它能够通过智能路由优化在多个推理服务工作负载之间的负载均衡性能,根...
使用ACK Gateway with Inference Extension实现推理服务的请求熔断
ACK Gateway with Inference Extension组件支持在开启推理服务智能负载均衡的同时配置熔断规则。当服务出现异常时,熔断机制可以自动切断有问题的服务连接,防止故障蔓延。本文介绍如何使用ACK Gateway with Inference Extension为推理服务配置流量熔断规则。
使用ACK Gateway with Inference Extension实现推理服务的流量镜像
ACK Gateway with Inference Extension组件在支持推理服务智能负载均衡的同时,也支持推理请求的流量镜像功能。在生产环境中部署新推理模型时,您可以通过流量镜像复制生产流量来评估新模型的表现,确保其性能和稳定性符合要求之后再正式上线。本文介绍如何使用ACK Gateway with Inference Extension来实现推理请求的流量镜像。
使用容器服务ACK快速部署QwQ-32B模型并实现推理智能路由
【阅读原文】戳:使用容器服务ACK快速部署QwQ-32B模型并实现推理智能路由 背景介绍 1. QwQ-32B模型 阿里云最新发布的QwQ-32B模型,通过强化学习大幅度提升了模型推理能力。QwQ-32B模型拥有320亿参数,其性能可以与DeepSeek-R1 671B媲美。模型数学代码等核心指标(...
阿里云容器服务AI助手2.0 - 新一代容器智能运维能力
【阅读原文】戳:阿里云容器服务AI助手2.0 - 新一代容器智能运维能力 前言 随着智算时代的到来,人工智能与大模型的发展正引领着一场前所未有的技术变革,AI工具的广泛应用更可谓是推动了各行各业的创新与发展。 智能运维AIOps,是阿里云容器服务团队追求基础能力建设的目标终态。大模型LL...
拥抱智算时代:阿里云容器服务智能、托管、弹性新体验
本文整理自先河、予栖和路先在2024云栖大会的演讲 很高兴在2024云栖大会容器计算专场,给大家分享容器服务的新产品体验,本次分享,我们聚焦容器服务是如何通过智能、托管、弹性的产品新体验,来助力客户拥抱智算时代的。 ...
拥抱智算时代:阿里云容器服务智能、托管、弹性新体验
【阅读原文】戳:拥抱智算时代:阿里云容器服务智能、托管、弹性新体验 本文整理自先河、予栖和路先在2024云栖大会的演讲 前言 ...
本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。