FLUX 3 Image: Maximum control over every pixel | Black Forest Labs
AI工具

FLUX 3 图像模型实测:画质、文字生成、速度与API价格

FLUX 3 Image 是什么,为什么值得关注

FLUX 3 Image是 Black Forest Labs 的图像生成与编辑模型,属于多模态模型 FLUX 3 的图像部分。它不仅根据文字生成图片,还把画布布局纳入提示过程:用户可以为文字、人物、建筑或其他元素指定边界框,再分别调整对应区域。

这种方式与只输入一段描述的文生图不同,更接近“先设计版式,再生成内容”。对于海报、广告视觉、产品图和需要精确构图的场景,重点不只是画质,也包括元素位置、局部修改和生成后保持其他区域不变的能力。本文后续将围绕这些能力,以及网页明确展示的分辨率和授权信息展开。

FLUX 3 Image: Maximum control over every pixel | Black Forest Labs
图片来源:原文

核心能力:用边界框控制构图

边界框(bounding box)就是画布中的矩形区域。用户为每个重要元素提供坐标和描述,再用一段全局提示词说明整个场景。FLUX 3 Image 使用 0 到 1000 的归一化画布坐标;每个元素以 [y_min, x_min, y_max, x_max] 表示位置。网页示例还展示了通过边界框指定标题、海滩人群、穹顶和海水中人物的做法。

不想手动安排所有区域时,也可以只提供一句需求和画面比例,由代理自动规划布局,生成全局描述、元素表和对应区域。之后仍可移动或编辑单个框,让模型在保留其余内容的前提下重新生成指定部分。

生成与编辑:面向精细修改

官方页面强调,模型支持原生全分辨率渲染,示例中包含 5456×3072 像素的图像,并展示了重着色潜水服和冲浪板、增加潜水员等局部编辑。页面还称可使用最多 10 个参考图像,以降低从零设计复杂画面的成本。

目前原网页明确给出的商业信息是:FLUX 3 Image 权重以商业权重许可证提供,面向大规模图像生成企业,支持在自有基础设施上微调和部署。页面未给出具体 API 价格、速率限制或统一的公开计费表,因此这些内容不应仅凭该页面推断。

我先依据已提供的官方页面材料,补齐使用流程、限制、部署与成本边界,再输出可直接接续的 HTML 片段。

如何使用 FLUX 3 Image

实际工作流可以分为四步:先确定画布比例和最终用途,再为标题、主体、背景或需要精确控制的物体建立边界框;随后为每个框填写元素描述,并用一段全局提示词交代光线、风格和场景关系;生成初稿后,移动或调整问题区域,最后只重生成对应框。坐标采用 [y_min, x_min, y_max, x_max],范围均为 0—1000,不能误写成常见的 [x_min, y_min, x_max, y_max]。

适合什么场景

它的优势集中在“构图可控”和“局部可改”:海报、广告视觉、产品展示、概念设计,以及需要反复修改人物位置、文字区域或颜色的项目,都比单纯反复抽卡更容易形成稳定流程。官方示例还展示了最多 10 张参考图、原生全分辨率渲染,以及 5456×3072 像素的生成结果。不过,示例展示的是模型能力,不等同于所有输入都能稳定得到同样尺寸或效果。

部署、价格与授权边界

截至原页面信息,FLUX 3 Image 提供的是面向企业大规模图像生成的商业权重许可证,可在自有基础设施上微调和部署。页面没有公开统一的 API 价格、速率限制或面向个人用户的计费表,因此不能据此计算单张图片成本,也不能把商业权重许可理解为默认包含所有平台调用权限。若团队采用自部署方式,还需要自行承担 GPU、存储、推理服务和模型微调成本。

使用限制与选择建议

边界框控制并不意味着像传统设计软件一样逐像素锁定结果:框内内容仍由模型生成,框之间的遮挡、透视和风格一致性需要通过全局提示词协调。元素很多时,先让代理规划布局,再人工检查框的位置和描述,通常比一次性手写复杂元素表更稳妥。若需求只是快速生成配图,普通文生图工具可能更省事;若核心要求是版式、局部编辑或自有基础设施部署,FLUX 3 Image 的定位更契合。


原始来源: https://bfl.ai/models/flux-3-image

Leave a Reply

Your email address will not be published. Required fields are marked *