All models

gpt-4o-mini

OpenAIChatvision
Input 0.3154 Credits / 1MOutput 1.2615 Credits / 1M
Get your API key
gpt-4o-mini

面向高频业务的轻量图文理解与对话模型

GPT-4o mini 是 OpenAI 的小型图文理解模型,适合客服回复、信息提取、邮件撰写和轻量代码辅助。它将长上下文、视觉理解与函数调用结合起来,便于把日常任务拆成可复用的处理步骤。对于需要频繁调用、任务边界清晰的应用,它是兼顾实用能力与资源效率的选择。

OpenAI模型品牌
对话模型类型
视觉理解任务能力

规格与接口特性

在选型前明确容量、输入输出与调用方式。

原生上下文
128K tokens
原生最大输出
单次最高16K tokens
知识截止
2023年10月
输入与输出
文本、图像输入;文本输出
工具协作
支持函数调用,可结合应用提供的数据与操作
调用入口
Responses、Chat Completions及AI Chat会话接口

上下文和最大输出为公开原生规格,本平台各入口的请求结构与实际可用范围按所选接口区分。

核心能力

了解 gpt-4o-mini 能为你的工作带来什么。

把长材料整理成可用答案

GPT-4o mini 可以结合较长的对话历史、邮件线程或代码材料生成回复,不必只围绕最后一句问题作答。适合提炼要点、整理待办和解释代码片段;提交时明确任务、保留相关材料,并指定交付格式,有助于让结果贴近业务目标。

从图片理解走向信息提取

它能够把文字要求与图片内容结合起来,用文字解释图像或提取可见信息。收据整理是典型用法:提供清晰图片,指定商户、日期、金额等字段,再将结果交给程序校验。这里的视觉能力用于理解图片,而不是生成或修改图片。

适合拆分任务的函数协作

模型支持函数调用,适合在对话中提出查询数据或执行操作所需的函数名与参数。应用可以接收调用请求、执行自己的业务代码,再将结果回填给模型组织答案。这样可将语言理解与确定性的业务逻辑分开,而不是让模型凭空推测系统状态。

适用场景

从具体任务出发,找到模型发挥作用的位置。

客服与工单回复

输入客户问题、相关政策和必要的历史沟通,让模型生成答复草稿、工单摘要与待确认事项。对多轮客服,可使用会话入口保存上下文并携带id续聊;对需要精确控制材料的系统,则自行维护messages,避免把无关历史持续累积。

收据与业务资料整理

将收据图片与字段要求一起提交,输出便于入库的文字或JSON结果;也可输入已经提取出的文档文本,整理分类、摘要和关键条款。交付时要求缺失字段留空,并保留原文片段供复核,金额与日期再由业务程序检查。

邮件与轻量开发辅助

提供邮件线程、收件人关系和回复目标,让模型起草保持上下文一致的邮件;提供代码片段、报错和预期行为,则可获取问题解释与修改建议。适合边界清楚的日常辅助任务,生成的代码仍需在自己的开发环境中测试。

如何选择这个模型

结合任务复杂度、输入材料与预期结果选择。

从GPT-3.5 Turbo迁移时

如果原有应用主要做文字回复、结构化提取和对话总结,GPT-4o mini值得纳入迁移测试。它相较GPT-3.5 Turbo具有更好的长上下文表现,并增加图像理解能力。建议用真实邮件、工单和收据样本比较字段准确率与回复质量,而不是只看模型名称。

与GPT-4o和绘图入口区分

GPT-4o mini侧重小型模型的资源效率,适合频繁执行清晰、可拆分的图文任务;是否改用GPT-4o,应根据实际任务质量要求进行比较。若目标是生成海报、修改参考图或输出图片,则应选择专门的图像生成入口,不能把mini的视觉理解当成绘图能力。

开始使用

从一次小规模任务到正式接入。

01

准备任务与材料

明确目标、必要输入与输出要求,使用真实业务样例作为起点。

02

在 API 调试区试用

打开试用页,确认此入口支持的参数,再提交小规模任务查看结果。

03

按 API 文档接入

保留完整模型 ID,使用文档规定的请求格式,并在 Pricing 页确认计费规则。

使用边界

在正式使用前,了解输出质量与能力范围。

  • 知识截止于2023年10月,不能仅凭模型记忆回答最新政策、实时库存或近期事件。需要时应由应用提供更新材料或查询结果,并要求答案依据这些材料组织;函数调用能力本身不等于每次请求都会自动联网。
  • 128K上下文与16K最大输出是不同指标,长输入不会带来同样长度的回复。处理长邮件链或大量代码时,应预留输出空间、删除重复内容并分段安排任务;托管会话也不意味着模型能够永久保留全部细节。
  • 视觉理解的结果需要结合图片质量复核。收据中的细小金额、模糊日期或被遮挡的字段不宜直接用于记账;建议提交清晰局部图并要求标出不确定项。音频、视频生成和推理等级调节不属于这里介绍的基本能力。

常见问题

解答使用 gpt-4o-mini 时的常见疑问。

GPT-4o mini能看图,也能画图吗?

它可以结合图片与文字问题生成文字答案,适合图像说明和可见信息提取,但不是绘图模型。Chat Completions中可在content数组里组合text和image_url块;若需要实际图片成品,应使用专门的图像生成或编辑模型。

怎样选择Responses或Chat Completions?

已有messages对话结构的应用可使用/openai/chat/completions,读取choices中的回答;采用响应式工作流可使用/openai/responses并提交input。两者都使用model: gpt-4o-mini,但输入组织方式与响应解析方式不同。

多轮对话需要每次重传历史吗?

自行使用Chat Completions时,应把需要的历史放入messages。若希望简化会话管理,可使用AI Chat会话接口,开启stateful并在后续请求携带返回的id。会话保存属于接口功能,不代表模型具有无限上下文。

函数调用会直接执行我的业务代码吗?

不会仅因定义函数就自动执行代码。模型可以返回函数名和参数,应用负责验证参数、执行相应操作并回填结果。查询订单、发送邮件等任务应分别配置权限与执行逻辑,尤其不要省略涉及写入操作的确认步骤。

能直接把PDF当图片传入吗?

PDF文件与图片输入不是同一种请求。对GPT-4o mini,清晰图片和已经提取的文本是这里介绍的主要输入方式。需要处理PDF时,可先提取正文或将相关页面转为图片,再按摘要、字段提取或问答目标提交内容。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 gpt-4o-mini 用到你的下一项任务

从清晰的目标开始,在实际结果中判断它是否适合你的工作。