ONESTRUCTION 借助 AWS GenAIIC 构建 Ishigaki-IDS 建筑行业基础模型:合成数据与三阶段训练实战
日本建筑科技初创 ONESTRUCTION 在 AWS GenAIIC 支持下,基于 Qwen3 构建了专为 BIM 工作流设计的 Ishigaki-IDS 基础模型。本文解析其合成数据、三阶段训练(CPT、SFT、RLVR)及 AWS 分布式训练架构,展示在数据稀缺领域打造专用模型的可行路径。
一句话看懂
日本建筑初创 ONESTRUCTION 用合成数据加三阶段训练,在 AWS 上打造了专为 BIM 的 IDS 标准设计的基础模型 Ishigaki-IDS,解决了数据稀缺领域的专用模型难题。
详细发生了什么
ONESTRUCTION 是一家日本建筑科技初创,专注用 openBIM 解决行业问题。在 AWS Generative AI Innovation Center(GenAIIC)的技术指导下,他们构建了 Ishigaki-IDS——一个专为建筑行业 BIM(Building Information Modeling)工作流定制的基础模型。BIM 是建筑全生命周期的数字化表示,日本因劳动力短缺而大力推广,但 BIM 采用需要专业知识,学习成本高。IDS(Information Delivery Specifications)是 2024 年发布的 XML 标准,用于定义 BIM 模型(IFC 模型)的附加信息及验证规则,编写 IDS 文件需要掌握其语法和 IFC 规则,门槛很高。Ishigaki-IDS 旨在降低这一门槛,让非 BIM 专家也能审查和管理属性信息。
构建过程中面临三大挑战:数据稀缺(IDS 是 2024 年新标准,公开数据极少)、IFC 词汇表注入(数千术语如 beam 对应 IfcBeam)、IDS 特定语法(结构随信息类型变化)。解决方案包括三阶段训练管线:持续预训练(CPT)注入领域知识,使用网络语料和内部专家生成的合成数据;监督微调(SFT)训练指令-输出对;基于可验证奖励的强化学习(RLVR),使用 buildingSMART 的 IDS-Audit-Tool 作为奖励函数,检查 XML 格式、IDS 结构有效性和语义一致性。模型基于阿里云开源的 Qwen3(8B/14B/32B),利用 AWS EC2 P5en 实例(NVIDIA H200 GPU)和 AWS ParallelCluster 进行分布式训练,数据存储于 Amazon FSx for Lustre。
评估使用自建基准 IDS-Bench,涵盖 IFC 版本、建筑专业(建筑、结构、机电、通用)、语言(日英)及 Implement/Structure/Content 轴。结果显示,Ishigaki-IDS 在 XML 结构合规和 IDS 结构合规上接近 100%,内容一致性超 80%;而通用前沿模型虽能生成良好 XML,但 IDS 结构合规低于 25%,内容一致性接近 0%。
中文圈视角
这个案例对中文圈有直接参考价值。首先,它展示了在数据稀缺的垂直领域构建专用模型的可行路径:合成数据加三阶段训练加可验证奖励。国内建筑行业同样面临 BIM 推广难、专业人才短缺的问题,类似 IDS 的标准化需求(如中国 BIM 标准)存在,但公开数据更少。Ishigaki-IDS 的方法论可复用于中文 BIM 标准或其它小众领域。
其次,模型基于 Qwen3,这是阿里云开源模型,中文能力天然有优势。国内开发者可直接借鉴其训练管线,在 ModelScope 或阿里云上复现,无需依赖海外服务。但需注意,IDS 标准本身是国际标准,中文场景可能需要适配本地规范,且 RLVR 依赖 buildingSMART 工具,国内是否有等效验证工具尚待探索。
此外,AWS 服务在国内不可直接使用,但 ParallelCluster 和 FSx for Lustre 有阿里云、华为云等替代品。整体思路比具体工具更重要,中文圈可关注合成数据生成策略和 RLVR 在结构化输出中的应用。
几条值得记住的细节
- IDS 标准于 2024 年发布,是建筑信息交付规范,基于 XML,用于验证 IFC 模型属性。
- 三阶段训练:CPT 注入领域知识,SFT 学习指令-输出对,RLVR 用 IDS-Audit-Tool 作为奖励函数。
- 模型基于 Qwen3(8B/14B/32B),支持多语言,适合日英双语场景。
- 训练基础设施:2 个 p5en.48xlarge 节点(NVIDIA H200 GPU),AWS ParallelCluster 编排,FSx for Lustre 存储。
- 评估结果:Ishigaki-IDS 在 IDS 结构合规接近 100%,内容一致性超 80%;通用模型结构合规低于 25%,内容一致性近 0%。
一句话总结
Ishigaki-IDS 证明,即使数据稀缺,用合成数据和可验证奖励也能构建专业模型,对中文垂直领域有借鉴意义。