伯阳智能体
方法论
能力
验证
服务
AI分身
国产加速卡上跑通 35B 级大模型 要验证'不靠进口卡也能跑大模型'这条路线能不能真落地,拿一个 FP8 量化的 35B MoE 模型上璧仞 BW 双卡试。先按常规加载→失败(平台 torch 2.4.1 不满足官方 FP8 加载链)→改路线:离线把 FP8 反量化成 bf16 再加载。国家超算互联网容器 + DTK(HIP 兼容层) + transformers 直推(平台推理引擎无对口版本,放弃自建引擎) 推理跑通,输出正确;同时抓到两个平台级坑(冷启动死锁特征、首次 forward 编译超 110s)并沉淀诊断法。国产卡模型适配 SOP:加速卡家族先探测(nvidia-smi/birensmi/dcu-smi)→vendor env.sh→架构名对注册表→反量化三验(mean/std 校验点)。
2026-09-04
(2026-09-04 记录,公开技术摘录。本站不展示客户信息、金额与内部系统名。)
本条属公开技术记录。看更多:
实战验证
·
方法论全库
·
全部记录