首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

GitHub 热门项目:AIInfra

2026-09-09 1 阅读 约9分钟阅读 GitHub Trending
分享:
字号:
GitHub项目:AIInfra 仓库地址:https://github.com/Infrasys-AI/AIInfra Stars:8145 | 作者:Infrasys-AI 项目描述:AIInfra(AI 基础设施)指AI系统从底层芯片等硬件,到上层软件栈支持AI大模型训练和推理。 ================================================== README 内容: # AIInfra 文字课程内容正在一节节补充更新,尽可能抽空继续更新正在 :octocat: [AIInfra](https://github.com/Infrasys-AI/AIInfra),希望您多多鼓励和参与进来!!! 文字课程开源在 :hamburger: [AIInfra](https://infrasys-ai.github.io/aiinfra-docs),系列视频托管[B 站 ZOMI 酱](https://space.bilibili.com/517221395)和 :yt: [油管 ZOMI6222](https://www.youtube.com/@zomi6222/videos),PPT 开源在 :octocat: [AIInfra](https://github.com/Infrasys-AI/AIInfra),欢迎引用! ## 课程背景 这个开源项目英文名字叫做 **AIInfra**,中文名字叫做 **AI 基础设施**。大模型是基于 AI 集群的全栈软硬件性能优化,通过最小的每一块 AI 芯片组成的 AI 集群,编译器使能到上层的 AI 框架,训练过程需要分布式并行、集群通信等算法支持,而且在大模型领域最近持续演进如智能体等新技术。 本开源课程主要是跟大家一起探讨和学习人工智能、深度学习的系统设计,而整个系统是围绕着 ZOMI 在工作当中所积累、梳理、构建 AI 大模型系统的基础软硬件栈,因此成为 AI 基础设施。希望跟所有关注 AI 开源课程的好朋友一起探讨研究,共同促进学习讨论。 与 **AISystem**[https://github.com/Infrasys-AI/AISystem] 项目最大的区别就是 **AIInfra** 项目主要针对大模型,特别是大模型在分布式集群、分布式架构、分布式训练、大模型算法等相关领域进行深度展开。 ![大模型系统全栈](static/images/aifoundation01.jpg) ## :clapper: 课程内容大纲 课程主要包括以下模块,内容陆续更新中,欢迎贡献: | 序列 | 教程内容 | 简介 | 地址 | | --- | --------------- | ------------------------------------------------------------------------------------------------- | ---------------------------- | | 00 | :checkered_flag: [大模型系统概述](#00-大模型系统概述) | 系统梳理了大模型关键技术点,涵盖 Scaling Law 的多场景应用、训练与推理全流程技术栈、AI 系统与大模型系统的差异,以及未来趋势如智能体、多模态、轻量化架构和算力升级。 | [Slides](./00Summary/) | | 01 | :checkered_flag: [AI 计算集群](#01-AI-计算集群) | 大模型虽然已经慢慢在端测设备开始落地,但是总体对云端的依赖仍然很重很重,AI 集群会介绍集群运维管理、集群性能、训练推理一体化拓扑流程等内容。 | [Slides](./01AICluster/) | | 02 | :checkered_flag: [通信与存储](#02-通信与存储) | 大模型训练和推理的过程中都严重依赖于网络通信,因此会重点介绍通信原理、网络拓扑、组网方案、高速互联通信的内容。存储则是会从节点内的存储到存储 POD 进行介绍。 | [Slides](./02StorComm/) | | 03 | :checkered_flag: [集群容器与云原生](#03-集群容器与云原生) | 讲解容器与 K8S 技术原理及 AI 模型部署实践,涵盖容器基础、Docker 与 K8S 核心概念、集群搭建、AI 应用部署、任务调度、资源管理、可观测性、高可靠设计等云原生与大模型结合的关键技术点。 | [Slides](./03DockCloud/) | | 04 | :checkered_flag: [分布式训练](#04-大模型训练) | 大模型训练是通过大量数据和计算资源,利用 Transformer 架构优化模型参数,使其能够理解和生成自然语言、图像等内容,广泛应用于对话系统、文本生成、图像识别等领域。 | [Slides](./04Train/) | | 05 | :checkered_flag: [分布式推理](#05-大模型推理) | 大模型推理核心工作是优化模型推理,实现推理加速,其中模型推理最核心的部分是 Transformer Block。本节会重点探讨大模型推理的算法、调度策略和输出采样等相关算法。 | [Slides](./05Infer/) | | 06 | :checkered_flag: [大模型算法与数据](#06-大模型算法与数据) | Transformer 起源于 NLP 领域,近期统治了 CV/NLP/多模态的大模型,我们将深入地探讨 Scaling Law 背后的原理。在大模型算法背后数据和算法的评估也是核心的内容之一,如何实现 Prompt 和通过 Prompt 提升模型效果。 | [Slides](./06AlgoData/) | | 07 | :checkered_flag: [大模型应用](#07-大模型应用) | 当前大模型技术已进入快速迭代期。这一时期的显著特点就是技术的更新换代速度极快,新算法、新模型层出不穷。因此本节内容将会紧跟大模型的时事内容,进行深度技术分析。 | [Slides](./07Application/) | ## 课程细节 ### **[00. 大模型系统概述](./00Summary/)** 系统梳理了大模型关键技术点,涵盖 Scaling Law 的多场景应用、训练与推理全流程技术栈、AI 系统与大模型系统的差异,以及未来趋势如智能体、多模态、轻量化架构和算力升级。 | 大纲 | 小结 | 链接 | 状态 | |:---:|:--- |:--- |:---:| | 概述 | 01. [Scaling Law 整体解读](./00Summary/01ScalingLaw.md) | [Markdown](./00Summary/01ScalingLaw
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱