实战验证记录

不是包装客户成绩,是公开我们解决问题的过程。POC 也是验证——方法比结果更值钱。

国产加速卡上跑通 35B 级大模型 已验证 · 2026-09-04

问题背景:要验证'不靠进口卡也能跑大模型'这条路线能不能真落地,拿一个 FP8 量化的 35B MoE 模型上璧仞 BW 双卡试。

尝试方案:先按常规加载→失败(平台 torch 2.4.1 不满足官方 FP8 加载链)→改路线:离线把 FP8 反量化成 bf16 再加载。

技术路线:国家超算互联网容器 + DTK(HIP 兼容层) + transformers 直推(平台推理引擎无对口版本,放弃自建引擎)

验证过程:读量化配置确认 weight_block_size/scale 语义→写反量化脚本(发现公式是乘法不是除法,写反输出全乱码)→26 分片转换 60-75 分钟→补 index.json 与丢弃 scale 残留张量→双卡加载 6-10 分钟→首次生成验证。

结果:推理跑通,输出正确;同时抓到两个平台级坑(冷启动死锁特征、首次 forward 编译超 110s)并沉淀诊断法。

沉淀能力:国产卡模型适配 SOP:加速卡家族先探测(nvidia-smi/birensmi/dcu-smi)→vendor env.sh→架构名对注册表→反量化三验(mean/std 校验点)。

商业情报全自动日更(万条级→可交付报告) 生产运行 · 2026-09-17

问题背景:客户要的是'每天替我盯生意信号',不是又一份手动周报。

尝试方案:全量导出→清洗→事件化→AI 判闸门→排行→交付。

技术路线:定时增量导出(游标防重叠) + 规则清洗 + LLM 双档判定(便宜档筛/贵档判) + 存在性守卫防缓存错判

验证过程:09-17 Day1 冒烟:窗口内 11,350 条原始→4,112 清洗→3,406 有效→291 事件→135 条过闸→TOP5 报告+14 条人工复核队列;A49+C12 次模型调用全部免费池。

结果:单日全自动出榜跑通,成本 ¥0;发现并修复'同日二次运行编号撞缓存'的静默错判隐患(改 per-run 目录)。

沉淀能力:可复用的情报流水线配方(导出/清洗/事件/闸门/排行五段式),换数据源即可迁移。

超算平台 742 张 MCP 卡真可用性终审 已验证 · 2026-09-17

问题背景:'生态里工具很多'是宣传话;哪些握手真通、哪些要 key、哪些是死壳,没人给过硬数据。

尝试方案:匿名搜索 API 全量拉目录→逐端点 GET+POST initialize→30s/45s 双档超时补测→抽样 tools/list+tools/call 实调。

技术路线:四层判据(握手/清单/实调/鉴权),拒绝抽样外推当结论

验证过程:585 唯一端点四轮免费实测;发现 ${API_KEY} 模板卡'握手过实调 401'假阳性、冷启动 serverless 30s 误杀(45s 救回 12 个)。

结果:终账:265 握手活,真免 key 可直挂仅少数,13 个'标需key实免key'漏网救回;三层报数口径(declared/去重/可测)钉死。

沉淀能力:端点级可用性审计方法论 + 一把真免费工具面(已接入自用)。

无备份事故中的文件完整恢复 已验证 · 2026-09-12

问题背景:数据盘突发故障,业务代码只有一份且从未 push。

尝试方案:不凭记忆重写——回放历史会话里的写入记录。

技术路线:会话库只读重放:write_file 全文 + read_file 快照为基底 + 按时间序应用后续 patch

验证过程:16 个文件逐一重放,基底合格线(行号连续/无截断标记)+ 恢复后 py_compile + import 链 + 真实跑入口双模式。

结果:全部恢复并跑通;确立'最后可证态'交底规则(恢复物≠毁盘前末笔)。

沉淀能力:状态重放恢复 SOP + 强制 git 基线化纪律(官网本次即按此先建 tag 再动手)。

公网实时语音 AI 分身 生产运行 · 2026-09-17

问题背景:B2B 客户晚上问'你们 AI 到底什么水平',文字回答没说服力。

尝试方案:直接让访客跟创始人数字分身实时说话。

技术路线:LiveKit 房间 + 服务端 token 签发 + 语音/文字双模 + 每日限轮防滥用

验证过程:麦克风权限分级提示、连接失败降级文字、限流拦截页、全程'对话由 AI 生成'合规标注。

结果:公网可体验已上线(zby.info/zhangzby),心跳误杀循环修复后稳定(watchdog 540次/日→0)。

沉淀能力:实时语音交付链路 + 真人化体验的边界感(限轮、留痕、可撤)。

本页记录随进化日志持续追加;被推翻的结论不删除,标注推翻原因。