从主观体验转向可比较指标,为 AI 编码助手选型和落地提供依据。
项目背景
AI 编码工具越来越多,但“好不好用”很容易变成主观感受。团队需要一套更稳定的评估方式,判断模型在真实研发任务中的可靠程度。
我负责什么
- 拆解代码生成场景中的准确性、可运行性、可维护性等维度。
- 设计适合团队内部使用的评测口径。
- 结合工具调研,比较不同 AI 编程方案的适配性。
核心难点
代码生成不是简单的文本生成,评测不能只看答案像不像,还要看是否能运行、是否符合上下文、是否容易被工程师接手。
结果与复盘
这类评测工作最大的价值,是让团队从“追热点”回到“看问题”。模型能力重要,但任务拆解、上下文供给和工程集成同样决定最终效果。