DeepSeekは8兆パラメータモデルの訓練を計画しています。
DeepSeek CEO 梁文锋は投資家に対して、同社が2兆パラメータのモデルを訓練中であり、その後8兆パラメータのモデルを開発する計画があることを明らかにしました。現在のフラッグシップV4-Proの総パラメータは1.6兆です。
現在公開されている超大規模モデルの中で、Moonshot AIのKimi K3は2.8兆パラメータに達しています。Kimi K3はMoEアーキテクチャを採用しており、2.8兆の総パラメータの中で各トークンが1040億パラメータを活性化します。DeepSeekが計画している8兆パラメータモデルの規模は、その約3倍に近いです。
DeepSeekは7月に500億元以上の資金調達を完了し、評価額は500億ドルを超えました。V4-Proは1.6兆の総パラメータ、490億の活性化パラメータでオープンソース化されています。
関連タグ






