资讯1 分钟阅读·
EdiTikZ自报:9B人工评测超GPT-5.6-Sol
基于Qwen3.5的9B科研TikZ图编辑模型,作者自报在9人4320次评分的人工评测中超过GPT-5.6-Sol、与Gemini-3.1-Pro相当。
重要性局部证据E2 未复现
基于Qwen3.5的EdiTikZ 4B/9B模型可编辑科研TikZ图,作者自报在9人4320次评分的人工评测中,9B高于GPT-5.6-Sol、与Gemini-3.1-Pro相当。
此前没有针对科研TikZ图编辑的专门模型;该工作从arXiv、GitHub与TeX SE挖掘39.1万对TikZ修订、推断78.1万条编辑指令用于训练。
测量方式为作者自报的人工评测:9名评分者共4320次评分,9B高于GPT-5.6-Sol、与Gemini-3.1-Pro相当;结果未经同行评审。
边界:仅覆盖科研TikZ图编辑,结果无第三方复现;预印本首版9月1日、9月14日更新(arXiv:2609.01409),模型与数据已开放,完整代码称即将发布。