
然而,AI 技术公司 Saturn 发布的 " 人工权威 " 研究报告对这一趋势提出警示。该报告对 ChatGPT、Gemini、Claude 和 Copilot 等 18 款主流 AI 工具进行测试,结果显示将 AI 作为财务顾问存在显著风险。
基准测试揭示高错误率
测试数据显示,AI 模型在处理财务问题时错误频发。17 个被测试模型的平均准确率仅为 43%,错误率高达 57%。在涉及税法规则及精确财务数据的复杂多步骤场景中,准确率骤降至 12%,错误率飙升至 88%。
付费模型的表现优于免费模型,前者失败率为 49%,后者为 63%。免费模型中,Claude Haiku 4.5 表现最差,错误或不完备答案比例达 82%;表现最佳的免费模型 ChatGPT-5.6 Luna ( max ) 错误率也达到 56%。
在所有参测模型中,Anthropic 的付费版 Claude Opus 5 ( reasoning ) 表现最优,通过率为 61%。即便作为佼佼者,其在近四成案例中仍未能给出正确答案,且在面对复杂问题时错误率高达 67%。
研究还列举了可能导致严重财务后果的错误案例:有模型声称大学毕业生移居海外可停止偿还学生贷款(实则可能增加月供);另有 Gemini 模型错误告知借款人,暂停抵押贷款还款不会影响信用评分。
用户信任面临考验
Saturn 报告指出,当前 AI 提供的财务建议并不可靠,盲目依赖可能导致用户蒙受巨额经济损失。
安永(EY)今年 3 月发布的报告曾显示,53% 的受访者倾向于使用 AI 助手进行投资决策,14% 偏好完全自主的 AI,33% 表示拒绝使用。随着此类高风险错误被曝光,涉及债务管理、学生贷款、抵押贷款、养老金及税务规划等敏感问题时,用户顾虑或将加剧,进而推高拒绝使用 AI 或选择完全自主决策的比例。
【星途科讯 图文丨伊贝 首发于 ZAKER 科技,转载请注明出处】