自研Runtime、Agent Loop、Infra:一家通用Agent公司的全栈赌注
Floatboat于2026年8月公布评测数据,其自研Harness配合DeepSeek-V4-Flash模型,在五项基准测试中全面超越价格高出57.1倍的Claude Opus 4.8。同一模型在DeepSeek官方Harness上未获一胜,接入Floatboat后五项全胜,增益随任务复杂度递增,短程任务仅提升1.9%,长程DeepSWE任务达23.6%。 该公司团队源自安卓OS生态,将Agent构建为桌面客户端,以文件管理器、编辑器、浏览器作为运行环境。其自研完整Runtime、Agent Loop、Tools及Infra,并采用FloatSail自适应进化系统。设计核心在于不强制所有任务经过Agent,简单操作可直接通过Workflow或桌面完成,仅在出现不确定性时由Agent介入。 Floatboat认为,长程任务难点在于交付标准模糊及模型漂移,其Harness侧重每步将结果拉回标准,支持回退、追问与自我校验。任务越复杂,Harness增益越大,HLR从0.78倍升至3.57倍。团队强调,评估Harness应关注任务收敛速度、错误局部化能力及单位成功交付成本。
本文摘要由千智坊基于公开报道整理,查看完整内容:阅读原文(InfoQ)→
