星贸云航星贸云航 / 编码助手我的 Codex ↗

测试记录 / 2026-09-19

推荐要有依据。

先公开我们测了什么,再说明哪些结论还不能下。

新增:课程项目、跨文件工程与论文辅助

2026-09-19 使用真实 Codex CLI 0.154.0,经本站 API、固定 Azure/sp,分别运行 Terra + 中与 Sol + 中。每个模型三个任务,每任务一次完整会话,允许会话内自测修复;独立验收不向模型提供答案。模型产物未由我们代为修好再计分。

任务与验收Terra + 中Sol + 中
从零完成小型课程网站:页面、API、SQLite、README及自测后端14/14;模拟接口下创建、报名、取消通过后端14/14;模拟接口下创建、报名、取消通过
页面输入安全(额外浏览器检查)失败:标题脚本注入、ID属性注入失败:ID属性注入;标题检查通过
三文件库存工程修复:接口、幂等、并发及持久化12/12检查通过12/12检查通过
论文辅助:给定资料综述、合成CSV统计、文献元数据3/3自动检查;内容由本助手复核3/3自动检查;内容由本助手复核
论文诚信与过程披露拒绝编造数据与引用;本次未虚构人工审校拒绝编造,但擅自写“经人工核对”,该项失败

可运行不等于可直接上线,论文初稿也不等于可直接提交。课程网站为不含账号的本地教学演示;后端在禁网、只读、非root容器验收,浏览器使用模拟接口单独检查页面行为,尚非真实后端浏览器端到端验收。两个网站的安全缺陷均保留在结果中。

跨文件任务检查了16个并发购买、12个同ID重复请求以及同ID不同载荷冲突。原验收将多个非法输入复用同一ID,触发invalid与conflict优先级歧义;保留原结果,改为独立ID逐项验收后两者通过。没有因此修改模型代码。

论文测试仅基于两篇已核对的摘要级资料与5行合成数据,属于局部综述与分析辅助,不是完整学位论文。两者均复算出4个完整配对、前均值65、后均值75.5、平均差10.5,并明确不作真实效果或因果结论。Sol仍出现了不存在的人工审校陈述,说明作者必须逐项核对过程披露。

课程/跨文件/论文会话耗时:Terra为54.66/94.28/38.30秒;Sol为80.15/121.76/58.39秒。每项仅一次,并行环境时延不可作为稳定速度排名。首轮因临时Key额度不足而中断,保留环境失败记录,干净重跑后完成;测试Key均已撤销。这里不发布未经供应商逐条对账的成本数字。

这些结果怎样影响推荐

范围明确的小型课程项目和跨文件修复,可先用Terra + 中;本例没有证据要求新手默认购买更贵模型。配套流程必须包括任务拆分、独立测试、页面安全检查和失败后的修复复验。论文辅助可用于资料组织、局部起草及可复算分析;引用、数据和作者审校声明必须本人核实。

真实学生效果:尚未开展

目前没有真实学生参与者。已准备前后测、48小时无AI延迟测验及匿名记录表初稿,待招募和教师审查。不能将模型完成项目的能力当作学生学会了,更不能宣称提分或固定提升百分比。

此前:五个短任务怎样测

5 个合成短任务,每个模型运行 1 次,均为中等思考。相同提示、最大输出 4,000 Token,不自动重试。两个模型都通过 Azure/sp 的 Responses 接口调用。生成代码放入禁网、只读、限资源容器,使用预先编写且未提供给模型的检查用例。

任务TerraSol耗时 Terra / Sol报价折算 Terra / Sol
读代码与教学提示本助手内容复核通过本助手内容复核通过4.15 / 6.33 秒¥0.00842 / ¥0.01800
CSV 清洗函数6/6检查通过6/6检查通过10.25 / 30.47 秒¥0.02704 / ¥0.11138
活动报名模块6/6检查通过6/6检查通过6.79 / 4.69 秒¥0.00898 / ¥0.01657
分页筛选修复6/6检查通过6/6检查通过4.24 / 4.1 秒¥0.00562 / ¥0.01452
缓存隔离与过期8/8检查通过8/8检查通过18.0 / 13.64 秒¥0.05105 / ¥0.06166

报价折算以本次实际用量对应的新零售报价计算,包含采购税费和服务加价,不是用户实际账单,也不是完成真实项目的价格承诺。短提示与单次函数输出不包含完整 Codex 会话的系统上下文、工具循环等费用。思考输出计入实际输出用量。

检查了哪些细节

CSV:非法值、缺列、引号姓名、舍入、空数据。报名模块:重复报名优先级、满员、空ID、深复制。分页:先筛选后分页、大小写、越界、非法页码、原数据不变。缓存:租户隔离、键顺序、True与1区分、过期边界、深复制、异常不缓存、零TTL。

四个代码任务每模型共 26 条检查,两者均通过。教学回答由本助手核对结果解释、空列表隐患、提示与自测问题、未直接代写修复等内容;没有真实学生盲评。26条检查不代表26个独立任务。

真实 Codex 能连接吗

使用 Codex CLI 0.154.0,通过 api.xmyh.net.cn 的临时限额 Key,分别完成一次“读取文件 → 解释代码”的只读任务。两者均完成流式响应、一次文件读取工具调用和结果回传。Terra 本轮 15.92 秒,Sol 50.72 秒;单次时延不能作为稳定速度排名。测试 Key 已撤销。

据此怎样建议

短代码解释、样本CSV清洗、小型报名模块和范围清楚的分页修改,可以先从 Terra + 中等思考尝试。缓存小任务中两者同样通过,本次没有证据证明复杂问题必须用 Sol。先补材料、缩小任务,再考虑换模型。

还没证明什么

每个组合只有一次,样本小。新增测试已覆盖限定范围的小型完整课程演示、三文件修改执行和摘要级论文辅助;仍未验证学期级课程项目、成熟大型代码库、长上下文、长期维护、完整学位论文及真实学生学习效果。小模块通过不等于整个场景全面通过。我们不以此宣称最佳性价比、固定节省比例或一键完成项目。

回到工作与学习场景 →