Arm 与微软合作,为基于 Arm 的 PC 和移动设备上的应用程序提供强劲的 AI 体验
Arm KleidiAI 在 ONNX Runtime 中的集成扩展了 Windows 和 Android 操作系统上的 AI 性能优化,使 AI 推理速度提升高达 2.6 倍,从而加速应用程序体验。
Arm KleidiAI 在 ONNX Runtime 中的集成扩展了 Windows 和 Android 操作系统上的 AI 性能优化,使 AI 推理速度提升高达 2.6 倍,从而加速应用程序体验。
通过 ONNX Runtime 针对端侧优化过的 DeepSeek R1,提升您的 AI 推理性能!本博客探讨了如何在 NPU、GPU 和 CPU 上高效运行 DeepSeek 模型,实现比 PyTorch 快高达 6.3 倍的速度提升。了解如何使用 Olive 框架和 Azure AI Foundry 对这些模型进行转换、量化和微调。
在对用户隐私、实时性能和成本效益不断增长的需求推动下,边缘 AI 正在改变 AI 格局。在 Ignite 大会上,我们很高兴地宣布 ONNX Runtime 生态系统中的四项新功能,旨在让边缘 AI 更易于访问。
带有 ONNX Runtime 的 MultiLoRA 通过支持轻松集成 LoRA 适配器,以极低的资源需求实现动态、个性化的模型,从而带来灵活、高效的 AI 定制。
2024年11月20日
了解如何使用 Olive 在模型优化工作流程中快速轻松地进行实验。
2024年11月19日
探索 Goodnotes 如何在 ONNX Runtime 的帮助下,将 iPad 上广受欢迎的涂抹擦除功能引入 Windows、Web 和 Android,从而实现跨平台的无缝、高性能 AI 集成。
2024年11月18日
了解如何使用全新的 Olive CLI 轻松优化用于端侧推理的 AI 模型
2024年11月11日
了解如何使用 Olive 的共享缓存来增强优化 AI 模型时的团队协作
2024年10月30日
使用带有 TensorRT 的 ONNX Runtime 进行 LightGlue 推理,性能显著优于 torch.compile。
2024年7月17日
将 NimbleEdge 与 ONNX Runtime 结合使用可提供毫秒级延迟和极少的资源占用,从而在移动应用中实现实时且保护隐私的个性化体验。
2024年6月17日
将 ONNX Runtime 与 WebGPU 和 WebAssembly 结合使用,速度比多线程 CPU 性能快 20 倍,比单线程 CPU 性能快 550 倍。从而直接在浏览器中实现最先进背景去除的交互式速度。
2024年6月12日
您现在可以在您选择的设备上运行 Phi-3 medium 和 small 模型。
2024年5月21日
利用 ONNX Runtime 在手机和浏览器中运行 Phi-3-mini。
2024年5月20日
多亏了 ONNX Runtime 和 DirectML,您现在可以在范围广泛的设备和平台上运行微软最新的自主研发 Phi-3 模型。
2024年4月22日
我们很高兴地宣布正式推出包含 WebGPU 功能的 ONNX Runtime Web,该功能现已在 ONNX Runtime 1.17 版本中可用。
2024年2月29日
从 Phi-2 模型优化到 CUDA 12 支持,阅读本文以了解有关 ONNX Runtime 1.17 版本中引入的一些令人兴奋的新功能的更多信息。
2024年2月28日
使用 ONNX Runtime 推理流行生成式 AI 模型的改进。
2024年2月26日
想在浏览器中为您的网站进行机器学习训练吗?请阅读下方的博客,了解 ONNX Runtime 网页训练所提供的功能,并通过我们简单易懂的教程和演示在您自己的应用程序中进行实验。
2024年2月6日
借助 ONNX Runtime 和 Olive,用户可以轻松加速 SD Turbo 和 SDXL Turbo 模型,只需区区一步即可生成可用的图像!
2024年1月15日
了解 ONNX Runtime 如何将 LLaMA-2 推理速度提升高达 4.5 倍
2023年11月14日
关于使用 ONNX Runtime 在边缘端运行 PyTorch 模型,您需要了解的一切。
2023年10月12日
了解有关 ONNX Runtime 如何帮助用户加速来自 Hugging Face 的开源机器学习模型的更多信息。
2023年10月4日
本博客介绍了使用 ONNX Runtime 进行端侧训练的技术细节。它解释了端侧训练的工作原理,以及训练过程中涉及的不同步骤和工件。这些信息将帮助您在边缘设备上训练模型。
2023年7月5日
了解 ONNX Runtime 如何加速 Whisper,并使其易于在桌面、移动设备、云端甚至浏览器中部署。
2023年6月7日
本博客介绍了端侧训练,以便使用边缘端可用的数据在边缘设备上训练模型。它将边缘端的 ORT 推理扩展到了包含联邦学习和个性化场景。
2023年5月31日
本博客回顾了 ONNX Runtime 和 Olive 工具链的新功能,以支持在 Windows 和其他平台上进行混合推理、NPU EP 以及硬件感知模型优化
2023年5月23日
本博客回顾了 Windows 11 中的 AI,包括作为通往 Windows AI 网关的 ONNX Runtime 以及 Windows 上的新 ONNX Runtime 功能
2023年5月23日
本博客展示了如何使用 Olive 为 ONNX Runtime 中的 DML EP 优化模型
2023年5月23日
本博客展示了如何使用 Olive 在 DML EP 上运行 Stable Diffusion 模型以对其进行优化
2023年5月23日
本博客展示了如何使用 ONNX Runtime 在 NVIDIA 和 AMD GPU 上加速来自 Hugging Face 的 Stable Diffusion 模型。其中包含在 A100、RTX3060 和 MI250X 上获取的基准测试结果。
2023年5月10日
ACPT 为用户提供了一个开箱即用的分布式训练环境,以便在 Azure 提供的最新多节点 GPU 基础架构上运行。借助 ACPT 中一项名为 Nebula 的全新快速检查点功能,您可以使用一个与训练过程异步工作的简单 API,以快 1000 倍的速度保存检查点。
2023年3月22日
通过使用深度神经网络 (DNN) 模型来启用各种场景对于 Oracle 的 AI 战略至关重要,我们的云 AI 服务团队构建了一个解决方案,为医疗保健行业的客户提供 DNN 模型服务。在这篇博客文章中,我们将分享团队面临的挑战,以及 ONNX Runtime 如何作为高性能推理成功的中流砥柱来解决这些挑战。
2023年3月15日
在本教程中,我们将学习如何在 C# 中对流行的 Stable Diffusion 深度学习模型进行推理。Stable Diffusion 模型接收文本提示并创建代表该文本的图像。
2023年3月9日
Microsoft Edge 中的 VSR 构建于 ONNX Runtime 和 DirectML 之上,使我们的解决方案能够在不同的 GPU 厂商之间移植,并使 VSR 能够供更多用户使用。未来,支持这些技术且具有足够计算能力的其他显卡也将获得支持。ONNX Runtime 和 DirectML 团队经过多年对技术的微调,使 VSR 能够充分发挥显卡处理能力的性能和功能。
2023年3月8日
在过去的一年里,OctoML 的工程师与 Watch For 紧密合作,为 ONNX Runtime 设计并实现了 TVM 执行提供程序 (EP) —— 将 Apache TVM 的模型优化潜力带给所有 ONNX Runtime 用户。这是在我们于 2021 年开始合作的基础上进行的,旨在将 TVM 的代码生成和灵活量化支持的好处带到微软的生产规模中。
2023年3月2日
端侧机器学习模型服务是一项艰巨的任务,鉴于早期初创公司的带宽有限,更是如此。这篇来自 Pieces 团队的客座博客分享了针对其端侧模型服务堆栈评估的问题和解决方案,以及 ONNX Runtime 如何成为他们成功的中流砥柱。
2023年2月8日
在本博客中,我们将讨论通过 Azure Machine Learning 使用 OpenVINO™ 神经网络压缩框架 (NNCF) 和带有 OpenVINO™ 执行提供程序的 ONNX Runtime,使 BERT 等庞大模型变得更小、更快的途径之一。
2023年1月25日
Hugging Face 的 Optimum 库通过与用于训练的 ONNX Runtime 集成,提供了一个开放的解决方案,可将许多流行的 Hugging Face 模型的训练时间缩短 35% 或更多。我们介绍了 Hugging Face Optimum 和 ONNX Runtime 训练生态系统的详细信息,并通过性能数据突出了使用 Optimum 库的好处。
2023年1月24日
选择使用哪个机器学习模型、与同事共享模型以及快速试用模型,都是您发现自己想要快速对模型进行推理的原因。您可以配置环境并下载 Jupyter notebook,但如果有一种方法可以以更少的精力运行模型,那就更好了……
2022年6月6日
基于 Transformer 的模型彻底改变了自然语言处理 (NLP) 领域。自诞生以来,Transformer 架构就被集成到诸如来自 Transformer 的双向编码器表示 (BERT) 和生成式预训练 Transformer (GPT) 等模型中,用于执行文本生成、摘要以及问答等任务……
2022年5月2日
随着应用机器学习在整个行业的发展,最先进深度学习模型的规模、性能和高效部署是普遍存在的挑战。我们很高兴地看到,我们在微软的高容量产品和服务中构建和使用的 ONNX Runtime 机器学习模型推理解决方案也在我们的开源社区中引起了共鸣,从而实现了推动内容相关性和生产力的新功能……
2022年4月19日
ONNX Runtime 现在支持使用 Xamarin 用 C# 构建移动应用程序。ONNX Runtime 1.10 版 NuGet 包中包含了对 Android 和 iOS 的支持。这使 C# 开发者能够为 Android 和 iOS 构建 AI 应用程序,以便使用 ONNX Runtime 在移动设备上执行 ONNX 模型……
2021年12月14日
我们正在介绍 ONNX Runtime Web (ORT Web),这是 ONNX Runtime 中的一项新功能,旨在使 JavaScript 开发者能够在浏览器中运行和部署机器学习模型。它还有助于启用新型的端侧计算。ORT Web 将取代即将弃用的 onnx.js……
2021年9月2日
用于 PyTorch 的 ONNX Runtime (ORT) 能够跨多个 GPU 加速大规模模型的训练,与 PyTorch 相比,训练吞吐量提升高达 37%,与 DeepSpeed 结合使用时提速高达 86%……
2021年7月13日
通过对您的 PyTorch 训练脚本进行简单更改,您现在可以使用运行在您选择的目标硬件上的 torch_ort.ORTModule 来加速大型语言模型的训练。训练深度学习模型需要不断增加的计算和内存资源。今天,我们发布了 torch_ort.ORTModule,以加速 PyTorch 模型的分布式训练,从而减少训练所需的时间和资源……
2021年7月13日
ONNX Runtime 是一个开源项目,旨在跨广泛的框架、操作系统和硬件平台加速机器学习。今天,我们很高兴地宣布发布 1.8.1 版本的 ONNX Runtime 预览版,该版本在 AMD ROCm™ 开放软件平台的协助下提供了对 AMD Instinct™ GPU 的支持……
2021年7月13日
GPT-2 和 GPT-3 等大规模 Transformer 模型是用于自然语言处理任务(例如语言翻译、问答、段落摘要、文本生成等)的最有用的自监督 Transformer 语言模型之一……
2021年6月30日