控制台 ↗
模型详情Gemini

gemini-3.1-pro-preview

复杂推理与多模态任务

能力概览

输入

文本图片视频音频PDF

输出

文本

复杂多模态推理

结合文本、图片、视频或音频完成分析。

视频理解

读取画面和音轨;复杂任务需要预留足够输出预算。

上下文1,048,576 tokens

输出上限65,536 tokens

内联请求建议控制在 20 MB 内

接口

POSThttps://www.yunqiai.chat/v1beta/models/gemini-3.1-pro-preview:generateContent

所有请求使用 HTTPS,并通过请求头携带访问密钥。

请求参数

参数类型说明
contents必填arrayContent 数组,每项含 role 与 parts
systemInstructionobject系统指令,结构同 Content
generationConfig.maxOutputTokensinteger最大输出 Token;上限随模型变化
generationConfig.temperaturenumber通常为 0–2,实际默认值与范围以模型为准
generationConfig.topPnumber0–1 的核采样阈值
generationConfig.stopSequencesstring[]停止序列
safetySettingsarray按危害类别设置安全阈值

请求示例

cURL
curl --request POST \
  --url https://www.yunqiai.chat/v1beta/models/gemini-3.1-pro-preview:generateContent \
  --header "x-goog-api-key: YOUR_API_KEY" \
  --header "Content-Type: application/json" \
  --data '{
    "contents": [
      {
        "parts": [
          {
            "text": "你好,请介绍一下你自己"
          }
        ]
      }
    ]
  }'

Base64 图片输入

Gemini 使用 inlineData,data 字段只放裸 Base64,MIME 类型放在 mimeType。

JSON · Base64
{
  "contents": [
    {
      "parts": [
        {
          "text": "描述这张图片"
        },
        {
          "inlineData": {
            "mimeType": "image/png",
            "data": "BASE64_IMAGE_DATA"
          }
        }
      ]
    }
  ],
  "generationConfig": {
    "maxOutputTokens": 256
  }
}

图片、视频、音频与 PDF

多模态文件放在 contents[].parts 中,提示词放在媒体内容块之后。视频会同时处理画面与音轨。

输入格式与范围适合场景
图片PNG、JPEG、WebP、HEIC、HEIF;通过 inlineData 传入识图、OCR、图表与界面分析
视频MP4、MPEG、MOV、AVI、FLV、MPG、WebM、WMV、3GPP;通过 inlineData 传入摘要、事件提取、时间点问答
音频填写实际音频 MIME 类型并通过 inlineData 传入转写、摘要、说话内容分析
PDF使用 application/pdf 并通过 inlineData 传入文档、扫描件与表格理解

视频参数

参数类型说明
inlineData.mimeType必填string填写 video/mp4 等实际 MIME 类型
inlineData.data必填string裸 Base64,不带 data:video/... 前缀
videoMetadata.startOffsetduration可选起点,例如 40s
videoMetadata.endOffsetduration可选终点,例如 80s
videoMetadata.fpsnumber抽帧率;默认约 1 FPS,长视频可低于 1,快速动作可适当提高
JSON · video
{
  "contents": [
    {
      "parts": [
        {
          "inlineData": {
            "mimeType": "video/mp4",
            "data": "BASE64_VIDEO_DATA"
          },
          "videoMetadata": {
            "startOffset": "0s",
            "endOffset": "30s",
            "fps": 1
          }
        },
        {
          "text": "概括视频中的主要事件,并给出对应时间点。"
        }
      ]
    }
  ],
  "generationConfig": {
    "maxOutputTokens": 2048
  }
}
传入方式

媒体放在 inlineData 中,data 填裸 Base64,mimeType 填实际文件类型。

请求大小

媒体、提示词和系统指令合计控制在 20 MB 以内。

片段范围

startOffsetendOffset 指定需要分析的视频片段。

抽帧率

fps 调整抽帧密度;快速动作可适当提高。

响应

JSON
{
  "candidates": [
    {
      "content": {
        "role": "model",
        "parts": [
          {
            "text": "你好!我是一个 AI 助手。"
          }
        ]
      },
      "finishReason": "STOP"
    }
  ],
  "modelVersion": "gemini-3.1-pro-preview"
}
YunQi AI 开放平台文档 · 客户接入与参数参考模型目录更新于 2026-08-06