2026智能互聯網藍皮書:人工智能語料呈現六大核心發展趨勢
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
人民網北京7月29日電 人民網研究院組織編寫的智能互聯網藍皮書《中國智能互聯網發展報告(2026)》今日在北京正式發布。其中,上海庫帕思科技有限公司行業研究員儀孝偉撰寫的《人工智能語料發展現狀與趨勢》一文指出,人工智能語料是驅動大模型性能的關鍵生產要素。目前國內語料供給已初具規模,行業市場規模持續高速增長,完整產業生態加速構建,整體呈現六大核心發展趨勢。
一是從互聯網知識向學術密集轉變。早期大模型依賴海量互聯網文本,雖知識面廣但存在噪聲大、事實准確性不足、邏輯鏈條不完整等缺陷。學術密集型語料則特指從經過嚴格同行評議的期刊論文、學術專著、專利文獻等萃取的高質量信息,其演進趨勢是構建高信噪比、邏輯嚴謹、富含知識密度的語料庫。
二是從兩維平面向立體高維轉變。核心是語料的形態從單一的文本“二維平面”,擴展為融合文本、圖像、音頻、視頻、3D點雲等“立體高維”綜合體。演進趨勢是實現多模態信息間的對齊和融合,以構筑逼近真實世界的虛擬學習環境,訓練出能夠像人類一樣理解世界的通用AI。
三是從關注規模的預訓練向聚焦質量的后訓練轉變。大模型發展正從依賴海量通用數據的“預訓練”階段,轉向依托高質量數據的“后訓練”階段。后訓練語料主要包括微調(SFT)數據、人類反饋強化學習(RLHF)數據、價值對齊數據等,直接實現能力的行業適配,教會AI“說話做事的規矩”,對齊人類偏好及價值觀。
四是從通用向通專結合和場景適配轉變。即AI發展從追求“一個模型解決所有問題”的通用主義,轉向“通用+專業”的協同模式。演進趨勢是形成“三個同心圓”語料體系,最外圈層是廣泛的通用語料,中間圈層是行業級語料,內圈層是具體企業或場景的私有化、個性化語料。
五是從原生數據向合成數據轉變。旨在克服高質量原生數據的稀缺性,使用AI生成符合要求的訓練數據,解決數據瓶頸。同時也是提升大模型魯棒性、保護數據隱私的有效手段。合成數據在關鍵特征和統計分布上與真實數據高度相似,且合成數據不存在任何真實個體信息。
六是從項目制向平台化嵌入式服務轉變。語料服務的商業模式面臨根本性轉變,傳統項目制“數據售賣”方式正被“咨詢+定制+應用+增值服務”的嵌入式語料服務模式替代,運營模式的平台化和生態型成為主流,“AI應用”正悄然帶動“數據飛輪”。(廖燦亮)
分享讓更多人看到
- 評論
- 關注





































第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量