Skill 广场
Gemini网页端图文生成 Skill

Gemini网页端图文生成.Skill

@jimliu/baoyu-danger-gemini-web

4.2推荐AI 评分基础检查通过源自 GitHub

该技能封装了 Gemini Web 网页版接口逆向调用流程,支持无需官方付费 API Key 即可调用 Gemini 3 Pro、Flash、Thinking 等模型。支持纯文本问答、基于多轮会话上下文的连续追问、利用提示词生成图像,以及上传参考图片进行视觉理解与多模态再创作。运行前包含免责授权检查,并通过本地 Chromium 内核浏览器捕获并自动维护 Google 会话 Cookie。

AI工作流需要高质量免费 Gemini 多模态与绘图能力的开发者搭建多 Agent 管道并寻求图像生成后端的 AI 工作流设计者希望在终端命令行直接与 Gemini 进行多轮对话的技术爱好者2026-09-23 更新main

Gemini网页端图文生成

该技能封装了 Gemini Web 网页版接口逆向调用流程,支持无需官方付费 API Key 即可调用 Gemini 3 Pro、Flash、Thinking 等模型。支持纯文本问答、基于多轮会话上下文的连续追问、利用提示词生成图像,以及上传参考图片进行视觉理解与多模态再创作。运行前包含免责授权检查,并通过本地 Chromium 内核浏览器捕获并自动维护 Google 会话 Cookie。

它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。

常见场景

它能帮你做什么?

01

命令行多模态图像生成:输入提示词或配合参考图片,直接在终端生成并保存高质量图像文件,作为本地设计素材或占位图。

02

多轮上下文问答与推理:通过指定 Session ID 维持多轮长对话历史,调用 Gemini 3 Flash Thinking 等模型完成复杂的思维链逻辑推导与内容撰写。

03

下游 Agent 技能的图文后端支撑:作为其他自媒体排版、图文报告生成 Skill 的底层依赖,自动提供图像生成与参考图分析能力。

三步完成

怎么使用

1安装 Skill

把右侧安装请求发给你的 AI。

2说清楚目标

告诉 AI 你想完成什么,或直接贴入内容。

3检查结果

按需要继续调整语气、范围或格式。

复制就能用

你可以直接这样说

调用 gemini-3-pro 模型,使用提示词“A cute cyberpunk cat in neon city”生成一张名为 cat.png 的图片

传入参考图 architecture.png 并让 Gemini 详细分析该建筑的结构风格与光影层次

基于现有会话 session-101 追问:“请结合上一轮总结的方案,编写具体的落地执行甘特图”

适用人群

适合谁?

需要高质量免费 Gemini 多模态与绘图能力的开发者搭建多 Agent 管道并寻求图像生成后端的 AI 工作流设计者希望在终端命令行直接与 Gemini 进行多轮对话的技术爱好者

上手门槛

使用难度

进阶

需要了解任务流程,页面已整理好使用步骤。

兼容范围

支持哪些 AI?

Codex可直接使用
Claude Code可直接使用
OpenClaw可直接使用
Hermes可直接使用
国内 Agent可直接使用

中文用户增强

Skill Px 做了什么?

中文说明简化使用方式补充中文案例整理安装流程降低理解难度