AI自己设计芯片跑自己:openTPU把RTL、ISA、编译器全写完,10个开源模型上板实测

2026年10月,GitHub用户FeSens发布了openTPU项目。这个项目的README只有一句话的定位:一个由AI开发的开源AI加速器。

RTL(硬件描述代码)、ISA(指令集)、仿真器、编译器、性能分析器,全部放进一个仓库,全部由AI智能体参与开发。它跑在一张浪潮YPCB-00338 PCIe卡上,核心是Xilinx Kintex-7 xc7k480t FPGA,配两条DDR3通道。

这不是概念验证的空架子。项目在10月1日到9日期间完成多轮生产镜像部署,10个现代开源模型带着真实权重在卡上跑通,输出结果与仿真器逐位(bit-for-bit)一致。

它回答了一个有意思的问题

openTPU的README开宗明义,抛出两个问题:

  • AI智能体在硬件设计上能走多远?
  • 它们能不能造出运行自己推理的芯片?

第一个问题,仓库给出了完整答案。1356次提交沉淀出完整技术栈:SystemVerilog写的RTL、自定义指令集(每条指令8个32位字)、Python位精确仿真器、名为ol的内核语言及编译器、名为Lens的分析器,还有驱动真实PCIe卡的主机软件。

第二个问题,答案藏在运行数据里。芯片造出来之后,Qwen3、Qwen3.5、LFM2.5这些模型就在这张卡上推理。AI设计了硬件,硬件再反过来运行AI自己的权重,整个循环在一台2014年的i7-4790主机旁边完成了。

实测数据:一张几百美元的FPGA卡能跑什么

先看这张卡的配置:Kintex-7 xc7k480t,4GiB DDR3-1066,峰值带宽17.1GB/s。以今天的标准看,这套硬件相当朴素,价格只是旗舰GPU的零头。

实测结果(2026年9月29日至10月1日多轮测量):

| 模型 | 精度 | 解码速度(设备) | 预填充速度 |

| — | — | — | — |

| LFM2.5-230M | int8 | 59.0 tok/s | 295.6 tok/s |

| LFM2.5-230M | 4-bit | 85.8 tok/s | 335.4 tok/s |

| Qwen3-0.6B | int8 | 21.6 tok/s | 92.1 tok/s |

| Qwen3-0.6B | 4-bit | 31.3 tok/s | 103.4 tok/s |

| Qwen3.5-2B | int8 | 8.02 tok/s | 38.2 tok/s |

| Qwen3.5-2B | 4-bit | 12.09 tok/s | 41.7 tok/s |

| SmolLM3-3B | 4-bit | 8.74 tok/s | 22.8 tok/s |

| Phi-4-mini (3.8B) | int8 | 3.99 tok/s | 13.8 tok/s |

几个关键观察:

解码是内存瓶颈。 解码阶段DRAM利用率跑到了82%-94%的峰值,说明这套设计已经把DDR3的带宽吃干榨净。项目下一步的工作清单里,第一条就是继续压榨LiteDRAM路径的最后几个百分点。

4-bit量化带来40%-45%提速。 4-bit权重用FP4值加两级块缩放,每个权重4.25比特,LM head保留int8保精度。每Token字节数砍掉约三分之一,解码速度提升40%(Qwen3.5)到45%(Qwen3、LFM2),代价是困惑度有可测的损失,每个模型的损失值都写在文档里。

MoE大模型也能跑。 超出4GiB显存的MoE模型采用专家流式加载。LFM2.5-8B-A1B(8.5B总参数、1.7B激活)跑到10.6 tok/s,98.5%的专家访问命中卡上槽位,每Token只需从主机流送5.2MB。Qwen3.5-35B-A3B(34.7B总参数)跑到3.95 tok/s,每Token流送153MB。

架构的取舍:故意做简单

openTPU的机器架构刻意保持简单。一个定序器每周期发射一条指令,几个执行单元各司其职:DMA搬数据,矩阵单元做int8乘法,向量单元做fp32运算,量化器把结果转回int8。

没有缓存,没有隐藏调度。每一次数据搬移都是一条显式指令,一条trace就能看清每个周期花在了哪里。

这个设计的价值在教学和可解释。Lens分析器可以从RTL、仿真器或真实卡片记录一次运行,在浏览器里打开:roofline图、时间线、逐指令表格,哪个单元在忙、在等DRAM、在等另一条指令,一目了然。想搞懂AI加速器从Python里的一个matmul到硬件连线是怎么工作的,这个仓库可以从头读到尾。

与同期芯片新闻对照着看

把openTPU放进10月的芯片新闻背景里看,更有意思。

谷歌发布了Gemini 4 Argon,主打百万Token输出打五折定价,公司内部却在质疑自家跑分;英伟达9月刚以129.3亿美元收购Hugging Face,攥住开源AI的入口;OpenAI被曝买下数万台Mac训练智能体,苹果统一内存成了GPU之外的第二条算力供应链。

巨头们在千亿级美元的算力军备竞赛里加码。openTPU展示的是另一个方向:一个人加一批AI智能体,用几百美元的FPGA卡和开源工具链,把完整的推理芯片做出来了。

两条路线不冲突。数据中心要的是极致吞吐,openTPU要的是可及性和透明度。Apache 2.0开源协议意味着任何人可以拿这套RTL去学习、修改、流片。硬件设计的门槛,第一次被AI拉低到了个人开发者够得着的位置。

对开发者的三个实际意义

学习材料。 仓库文档明确建议从docs/isa.md读起:指令集是地基,内核编译、RTL、整模型文档、物理卡片文档依次展开。仿真器本身就是规格说明,改ISA、RTL前跑通pytest即可验证。

AI辅助硬件设计的工作流样本。 项目前身auto-arch-tournament用锦标赛机制让多轮Vivado运行互相竞争,自动优化时序余量和面积。当前设计的133.33MHz主频只勉强收敛(WNS +0.032ns),锦标赛还在继续跑。这种「AI出设计、工具链验证、多轮迭代」的循环,是硬件设计自动化的一条可复制路径。

端侧推理的参考设计。 82%-94%的DRAM利用率证明小模型推理的瓶颈在内存带宽。对做端侧设备的团队,这套「量化+显式数据流+无缓存架构」的组合拳值得研究。

写在最后

openTPU的Star数还只有34,是个早期项目。README也没有说明RTL、ISA、编译器里AI生成与人工修改的具体比例,未披露智能体框架和所用模型。AIWeekly的报道直接点出:这是一个方法论实验,而非产品。

实验的意义在于打破了「芯片设计只有大厂玩得起」的假设。AI智能体能从RTL写到编译器,意味着个人开发者和AI大厂手里的工具差距,比以往任何时候都小。

下一次芯片设计竞赛,参赛者未必都有数十亿美元的预算。

项目地址:https://github.com/FeSens/openTPU


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号