GPT-6 Luna 对比 Gemini 3.5 Flash-Lite:提取数据选谁?

比较 GPT-6 Luna 与 Gemini 3.5 Flash-Lite 的文本提取费用、输入说明和验收方法。用明确算例区分 JSON 格式正确、字段正确与最终合格记录。

暖灰背景上,浅色卡纸承托黑色打字机线稿,旁有圆点,标题为 Luna vs Gemini 3.5 Flash-Lite。

只做文本提取时,GPT-6 Luna 的标准 token 单价更低;Gemini 3.5 Flash-Lite 文档还明确列出音频、视频等输入。 选择时要看正确提取的完整记录,而不是只看返回 JSON 是否能解析。价格和综合榜单都不能证明谁更懂你的单据。

本文于2026年9月25日核对官方资料,没有两模型对照实测。费用均为厂商直连美元牌价和假设用量算例,不是 Ofox 报价或生产节省数据。

先让两边处理同一个任务

可先给两边相同的已提取文本,要求输出供应商、发票号、币种、总额及对应原文。这能将字段提取与 PDF 解析、图片预处理、语音转写分开。如果实际输入是扫描件或录音,还要另测完整流程,不能用文本测试替代。

项目GPT-6 LunaGemini 3.5 Flash-Lite
精确 IDgpt-6-lunagemini-3.5-flash-lite
模型页输入说明文本、图片模态文本、图片、视频、音频、PDF 输入
文本及结构化输出支持支持
输入上限922,000 token1,048,576 token
输出上限128,000 token65,536 token

依据:Luna 模型页、Gemini 模型页。两份输入说明不是同一口径的文件格式矩阵;Luna 的模态清单不能证明某端点不接受 PDF,文件输入及计费要另核对。窗口上限也不是建议每次塞满文档,应保留原文位置,并为输出留空间。

先算 token 费用,再讨论质量

Standard 短文本请求,每百万 token 的美元费率:

类别LunaGemini 3.5 Flash-Lite
普通输入$0.10$0.30
缓存读取$0.01$0.03
输出$0.50$2.50

假设1000份文档,每份2000普通输入、200计费输出 token,总量是200万输入、20万输出。Luna 为 $0.30,Gemini 为 $1.10。算例未包含缓存、重试、推理用量差异、工具、预处理、地域附加费和税。相同文本不一定产生相同 token 数,计费输出也可能包含推理。

Luna 单次输入超过272K后,整次输入及缓存费率翻倍,输出费率乘1.5;不能把短请求算例直接套到一份超长输入。Gemini 缓存存储另收每百万 token 每小时1美元,Luna 短输入缓存写入另列每百万 token $0.125。两种机制需要分别建账。来源:OpenAI 价格、Google 价格,以及Luna 计费说明。

JSON 格式正确,不等于总额正确

先定义缺失值。原文没有说明币种,就返回 schema 允许的缺失表示,不要仅凭美元符号推断 USD。规范化金额的同时保留原文片段,方便追溯。

字段验收要求需要保留的失败类别
发票号与原文一致编造编号
币种原文明确支持凭国家猜测
总额金额和小数解释正确把税额或小计当总额
依据原文中真实存在编造看似合理的引文

Google 结构化输出文档说明格式约束,但语义还要自己验。两边使用相同字段定义,接口 schema 则按各自支持范围适配。配置被拒绝是接入问题,不能直接归为提取能力差。

让评估集暴露真实问题

样本包含正常单据、缺字段、多个冲突金额、不同小数分隔符、重复页和夹带无关指令的文本。文档里的指令应作为数据处理。预期答案不放进提示词,分别记录格式通过率、字段准确情况、无依据字段和整条记录合格情况。

拒绝、截断、超时和格式错误都单列。保留每次重试与人工修正,否则低 token 费用可能掩盖高返工成本。可从Luna 提取流程开始搭建校验。

干净文本、紧凑 schema 和费用优先时,可以先评估 Luna;实际需要 Google 已明确列出的音视频输入时,可以先评估 Gemini 接入。PDF 要核对具体端点后再决定。这些是测试顺序,不是实测排名。

若简单记录能由小模型完成,异常再升级,应核对误放行和复核费用,而不是只算升级比例。参见Luna 转 Sol 路由。最终结论应附数据集范围和运行条件,让“适合提取”指向明确任务。

常见问题

谁的标准文本 token 单价更低?
核验时的短输入标准价为:Luna 每百万输入/输出 token $0.10/$0.50;Gemini 3.5 Flash-Lite 为 $0.30/$2.50。合格记录成本还受实际用量和错误影响。
结构化输出保证提取正确吗?
不保证。Schema 约束的是结构,字段值、单位、缺失值和原文依据仍需独立校验。
能直接比较 PDF 输入能力吗?
两份模型文档描述层次不同,不能仅凭 Luna 的文本/图片模态列表判断它不支持 PDF。应核对实际端点的文件输入及计费,纯文本对照则使用相同提取文本。