Gemini网页端图文生成
该技能封装了 Gemini Web 网页版接口逆向调用流程,支持无需官方付费 API Key 即可调用 Gemini 3 Pro、Flash、Thinking 等模型。支持纯文本问答、基于多轮会话上下文的连续追问、利用提示词生成图像,以及上传参考图片进行视觉理解与多模态再创作。运行前包含免责授权检查,并通过本地 Chromium 内核浏览器捕获并自动维护 Google 会话 Cookie。
它会先理解你的原始内容和目标,再按清晰的步骤完成处理。你不需要学习复杂命令,也不用理解背后的技术细节。
常见场景
它能帮你做什么?
命令行多模态图像生成:输入提示词或配合参考图片,直接在终端生成并保存高质量图像文件,作为本地设计素材或占位图。
多轮上下文问答与推理:通过指定 Session ID 维持多轮长对话历史,调用 Gemini 3 Flash Thinking 等模型完成复杂的思维链逻辑推导与内容撰写。
下游 Agent 技能的图文后端支撑:作为其他自媒体排版、图文报告生成 Skill 的底层依赖,自动提供图像生成与参考图分析能力。
三步完成
怎么使用
把右侧安装请求发给你的 AI。
告诉 AI 你想完成什么,或直接贴入内容。
按需要继续调整语气、范围或格式。
复制就能用
你可以直接这样说
“调用 gemini-3-pro 模型,使用提示词“A cute cyberpunk cat in neon city”生成一张名为 cat.png 的图片”
“传入参考图 architecture.png 并让 Gemini 详细分析该建筑的结构风格与光影层次”
“基于现有会话 session-101 追问:“请结合上一轮总结的方案,编写具体的落地执行甘特图””
适用人群
适合谁?
上手门槛
使用难度
需要了解任务流程,页面已整理好使用步骤。
兼容范围
支持哪些 AI?
中文用户增强