AI

AIによって開発されたオープンソースのAIアクセラレータ「openTPU」が登場


AIを使ってAI向けハードウェアを設計するオープンソースプロジェクト「openTPU」が公開されています。openTPUは、AIモデルを高速に動かすための専用アクセラレーターをAIエージェントも活用しながら開発する試みで、Qwen3やQwen3.5、Gemma 4など複数の言語モデルを実際のFPGAカード上で動かすことに成功しています。

GitHub - FeSens/openTPU: An open-source AI accelerator, developed by AI: RTL, ISA, simulator, compiler and profiler in one repo. Runs Qwen3, LFM2.5 and Qwen3.5 on a Kintex-7 PCIe card. · GitHub
https://github.com/FeSens/openTPU


openTPUはGoogleのTPUを再現するのではなく、「AIエージェントはどこまでハードウェア設計をこなせるのか」「AIが自分自身を動かすためのチップを設計できるのか」を確かめるプロジェクト。単にAI向けハードウェアを作るだけでなく、その設計過程自体をAIに担わせている点が特徴で、ソフトウェアから回路まで一通り公開されているため、AIアクセラレーターの仕組みを学ぶための教材としての利用も想定されています。

openTPUの構造は命令を順番に発行するシーケンサーを中心に、メモリとのデータ転送を担当するDMA、行列演算を実行する行列演算ユニット、浮動小数点演算を行うベクトルユニット、結果を量子化するユニットなどを組み合わせ、意図的にシンプルになるように設計されているとのこと。一般的なCPUやGPUのようなキャッシュや複雑な命令スケジューリングを持たず、データ移動も命令として明示的に扱うため、「どの処理に何クロックかかったのか」を追跡しやすくなります。


開発者はAMDのKintex-7を搭載したFPGAカードにopenTPUの回路を書き込んで実際のハードウェア上で動作を検証。その結果、LFM2.5-230MやQwen3-0.6B、Qwen3.5-0.8B、Gemma 4、Phi-4-miniなど複数のモデルを動作させています。

例えば、4bitに量子化したLFM2.5-230Mでは毎秒82.1トークン、Qwen3-0.6Bでは毎秒30.7トークン、Qwen3.5-0.8Bでは毎秒23.3トークンの生成速度を記録しています。


また、openTPUはカード上のメモリに収まらない大規模モデルにも対応しているそうで、必要なデータだけをPC側から送り込む仕組みにより、347億パラメータのQwen3.5-35B-A3Bも毎秒3.95トークンで動作させたと開発者は報告しています。

記事作成時点では、openTPUはAIの計算そのものよりも、モデルのデータをメモリから読み出す速度が性能の大きな制約になっているとのこと。そのため、今後はメモリアクセスの効率化や、入力文を最初に処理するプリフィルの高速化などが課題とされています。

なお、openTPUはApache License 2.0で公開されています。

・関連記事
TPU vs GPU、なぜGoogleは長期的にAI競争に勝てる立場にあるのか? - GIGAZINE

GoogleがAI処理チップの第8世代TPUを発表、学習特化の「TPU 8t」と推論特化の「TPU 8i」が存在しワットあたりの性能は2倍に - GIGAZINE

AnthropicがSamsungと独自のAIカスタムチップ開発について協議しているという報道 - GIGAZINE

Googleが宇宙にAIデータセンターを設置する実証実験「Project Suncatcher」でAI専用チップ・TPUを搭載した人工衛星を10月1日に打ち上げ - GIGAZINE

in AI,   ハードウェア, Posted by log1i_yk

You can read the machine translated English article OpenTPU, an open-source AI accelerator d….