cba24349cb
- api.md: 标记 register/login 接口为已完成(handler + User model) - backend.md: 分层结构标注已有文件,与实际代码对齐
13 KiB
13 KiB
后端工程
技术选型
- HTTP 框架:Gin
- 管线编排:Eino
compose.Graph— 四阶段管线,含质检→重生成分支 - AI 组件:Eino 的 model / tool 组件,统一接口便于替换模型提供商
分层结构
backend/internal/
├── handler/ # HTTP handlers(薄层,只做参数绑定 + 调用 service)
│ ├── health.go # [已有] 健康检查
│ ├── register.go # [已有] 用户注册(handler 骨架 + 参数校验)
│ ├── login.go # [已有] 用户登录(handler 骨架 + 参数校验)
│ ├── project.go # 工程 CRUD + 任务列表
│ ├── generate.go # 生成任务提交 / 查询 / WebSocket
│ └── project_style.go # 工程风格 CRUD
├── service/ # 业务逻辑层
│ ├── pipeline.go # [已有] Eino compose.Graph 编排:PromptBuilder → AssetGenerator → QualitySupervisor → FormatAdapter
│ ├── nodes.go # [已有] 管线四个节点的实现(每个节点单一职责)
│ ├── types.go # [已有] 管线输入/状态/输出的显式结构体定义
│ ├── inference.go # [已有] AI 推理 API 调用封装(当前为 mock 实现)
│ ├── pipeline_test.go # [已有] 管线测试(happy path / 重试 / 降级 / 风格合并)
│ ├── auth.go # 用户认证:注册、登录、JWT 签发与校验
│ └── project_style.go # 工程风格管理 & 风格合并逻辑
├── model/ # 数据模型 / DTO
│ ├── response.go # [已有] 统一响应
│ ├── user.go # [已有] 用户模型
│ ├── task.go # 生成任务 & 素材
│ └── style.go # 工程风格 & 任务风格覆盖
├── middleware/ # 中间件
│ ├── logger.go
│ ├── auth.go # JWT 认证中间件(从 Cookie 读取 Token)
│ └── ratelimit.go
├── config/ # [已有] 配置
│ └── config.go
├── queue/ # 异步任务队列
│ └── jobqueue.go
└── cache/ # 缓存层(请求去重)
└── cache.go
分层原则
- handler:只做参数绑定、校验、调用 service、返回响应。一个 handler 对应一组 API 路由。
- service:承载所有业务逻辑。
pipeline.go通过 Einocompose.Graph编排四个节点;nodes.go实现各节点逻辑;types.go定义显式状态结构体。 - model:纯数据结构,不含业务逻辑。
多阶段生成管线
gen2d 的核心生成流程采用 Eino compose.Graph 编排的四阶段管线,含质检不通过时的重生成分支。
flowchart LR
A["PromptBuilder\n(提示词工程)"] --> B["AssetGenerator\n(AI 出图)"]
B --> C["QualitySupervisor\n(质检)"]
C -- pass --> D["FormatAdapter\n(格式适配)"]
C -- fail --> A
各阶段职责
1. PromptBuilder
- 输入:用户文本 + 素材类型标签 + 工程风格 + 任务风格覆盖 + 技术参数
- 输出:三段式完整生成提示词
- 职责:
- 解析用户文本,提取核心内容作为【主题】
- 合并工程风格与任务风格覆盖(任务同名键覆盖工程),生成【约束】(含负面提示词)
- 注入素材类型、分辨率等技术参数作为【内容】
- 拼接为最终提示词
- 重试时:将上次质检的 RejectReason 注入【约束】段,指导 AI 修正问题
风格合并:
finalStyle = merge(projectStyle.KVPairs, taskStyle.KVPairs)
工程风格保证同一工程下所有素材风格一致;任务风格仅覆盖需要差异化的键。
三段式提示词结构:
【主题】用户的原始描述核心内容
【约束】风格键值对生成的约束条件 + 负面提示词 + [重试时] 上次质检问题:{rejectReason}
【内容】素材类型、分辨率、帧数等技术参数
2. AssetGenerator
- 输入:PromptBuilder 的输出
- 输出:原始生成图片(单张或多张)
- 职责:调用 AI 推理 API 出图。不同素材类型的差异化需求已在上一步注入提示词中。
- 接口规范:统一采用 OpenAI 兼容的
/v1/images/generations格式。多张生成通过n参数请求,实际支持数量取决于后端模型(如 DALL-E 3 仅支持n=1,需多次调用模拟多张)。
3. QualitySupervisor
- 输入:原始生成图片 + 风格配置
- 输出:通过 / 不通过 + 不通过的原因
- 职责:通过视觉模型检查素材是否符合提示词要求与风格约束。不通过时,Graph 分支将 RejectReason 回填到 PipelineState,路由回 PromptBuilder 重新生成(最多 3 次,超过则降级输出)。
4. FormatAdapter
- 输入:通过质检的图片 + 素材类型
- 输出:游戏引擎可用的素材文件 + 元数据
- 职责:格式转换、spritesheet 打包、元数据生成。
- 示例:输入 4 张 64×64 的角色行走帧 PNG → 输出一张 256×64 的 spritesheet + JSON 元数据(帧尺寸、帧数、锚点偏移),可直接拖入 Unity 2D Animation 使用。
管线设计(Eino compose.Graph)
类型定义(types.go)
// PipelineInput 管线入口输入
type PipelineInput struct {
Prompt string // 用户原始文本
AssetType string // 素材类型:sprite / background / ui / animation
ProjectStyle map[string]string // 工程风格键值对
TaskStyle map[string]string // 任务风格覆盖
Params AssetParams // 技术参数(分辨率、帧数、格式等)
}
// PipelineState Graph 全局状态,通过 WithGenLocalState 注入
type PipelineState struct {
Input PipelineInput
FinalPrompt string // PromptBuilder 输出的三段式提示词
RawImages []GeneratedImage // AssetGenerator 输出的原始图片
PassQuality bool // QualitySupervisor 质检结果
RejectReason string // 质检不通过原因
RetryCount int // 重试次数
}
// PipelineOutput 管线最终输出
type PipelineOutput struct {
Assets []Asset // 生成结果素材列表
Metadata AssetMetadata // 元数据(分辨率、帧数、格式)
}
编排入口(pipeline.go)
const (
nodePromptBuilder = "prompt_builder"
nodeAssetGenerator = "asset_generator"
nodeQualitySupervisor = "quality_supervisor"
nodeFormatAdapter = "format_adapter"
)
func NewGenerateGraph() (*compose.Graph[PipelineInput, PipelineOutput], error) {
g := compose.NewGraph[PipelineInput, PipelineOutput](
compose.WithGenLocalState(func(ctx context.Context) *PipelineState {
return &PipelineState{}
}),
)
// 添加节点
_ = g.AddLambdaNode(nodePromptBuilder, promptBuilderNode,
compose.WithStatePreHandler(promptBuilderPreHandler), // 重试时注入 RejectReason
compose.WithStatePostHandler(promptBuilderPostHandler))
_ = g.AddLambdaNode(nodeAssetGenerator, assetGeneratorNode,
compose.WithStatePostHandler(assetGeneratorPostHandler))
_ = g.AddLambdaNode(nodeQualitySupervisor, qualitySupervisorNode,
compose.WithStatePostHandler(qualitySupervisorPostHandler))
_ = g.AddLambdaNode(nodeFormatAdapter, formatAdapterNode)
// 连线:正常路径
_ = g.AddEdge(compose.START, nodePromptBuilder)
_ = g.AddEdge(nodePromptBuilder, nodeAssetGenerator)
_ = g.AddEdge(nodeAssetGenerator, nodeQualitySupervisor)
_ = g.AddEdge(nodeFormatAdapter, compose.END)
// 连线:质检分支
_ = g.AddBranch(nodeQualitySupervisor, compose.NewGraphBranch(
func(ctx context.Context, state *PipelineState) (string, error) {
if state.PassQuality {
return nodeFormatAdapter, nil
}
if state.RetryCount >= 3 {
return nodeFormatAdapter, nil // 超过重试次数,降级输出
}
return nodePromptBuilder, nil // 重生成
},
map[string]bool{nodePromptBuilder: true, nodeFormatAdapter: true},
))
return g, nil
}
节点实现(nodes.go)
每个节点是 Graph 中的 Lambda,通过 StatePreHandler / StatePostHandler 读写全局状态:
| 节点 | Lambda 输入→输出 | State 交互 | 职责 |
|---|---|---|---|
| PromptBuilder | PipelineInput → string |
PreHandler 读取 RejectReason,PostHandler 写入 FinalPrompt | 合并风格 → 生成三段式提示词(重试时注入质检问题) |
| AssetGenerator | string → []GeneratedImage |
PostHandler 写入 RawImages | 调用 AI 推理 API 出图 |
| QualitySupervisor | []GeneratedImage → bool |
PostHandler 写入 PassQuality + RejectReason + RetryCount | 视觉模型质检 |
| FormatAdapter | []GeneratedImage → PipelineOutput |
无 | 格式转换、spritesheet 打包 |
// PromptBuilder 节点:接收输入,输出提示词
var promptBuilderNode = compose.InvokableLambda(func(ctx context.Context, in PipelineInput) (string, error) {
return buildPrompt(in), nil
})
// StatePreHandler:重试时将 RejectReason 注入输入
func promptBuilderPreHandler(ctx context.Context, in PipelineInput, state *PipelineState) (PipelineInput, error) {
if state.RetryCount > 0 && state.RejectReason != "" {
// 将上次质检问题附加到输入中,供 buildPrompt 注入【约束】段
in.RejectReason = state.RejectReason
}
return in, nil
}
// StatePostHandler:将提示词写入全局状态
func promptBuilderPostHandler(ctx context.Context, out string, state *PipelineState) (string, error) {
state.FinalPrompt = out
return out, nil
}
// QualitySupervisor StatePostHandler:写入质检结果和重试计数
func qualitySupervisorPostHandler(ctx context.Context, out bool, state *PipelineState) (bool, error) {
state.PassQuality = out
if !out {
state.RetryCount++
state.RejectReason = "风格不一致" // 实际由视觉模型返回
}
return out, nil
}
运行入口
func RunPipeline(ctx context.Context, in PipelineInput) (*PipelineOutput, error) {
g, err := NewGenerateGraph()
if err != nil {
return nil, err
}
r, err := g.Compile(ctx)
if err != nil {
return nil, err
}
return r.Invoke(ctx, in)
}
关键实体
| 实体 | 说明 | 关系 |
|---|---|---|
| Project | 顶层容器,用户创建的项目 | 1──1 ProjectStyle, 1──N Task |
| ProjectStyle | 工程级键值对风格配置,保证同一工程下所有素材风格一致 | 属于 Project |
| Task | 工程下的单次生成请求,包含用户文本、素材类型、任务风格覆盖、技术参数、状态、结果 | 属于 Project, 1──N Asset |
| Prompt | PromptBuilder 输出的三段式提示词(主题+约束+内容),管线中间产物,不持久化 | 由 Task 生成 |
| Asset | 生成结果素材,关联到任务,包含 URL、元数据(分辨率、帧数、格式) | 属于 Task |
ER 关系图与外键约束详见 数据存储 — ER 关系。
风格模型
工程风格(Project Style)
工程级别,保证同一工程下所有素材风格一致:
type ProjectStyle struct {
ID string `json:"id"`
ProjectID string `json:"projectId"`
KVPairs map[string]string `json:"kvPairs"` // 如 {"artStyle":"pixel","palette":"warm"}
CreatedAt time.Time `json:"createdAt"`
UpdatedAt time.Time `json:"updatedAt"`
}
任务风格覆盖(Task Style Override)
任务级别,仅覆盖需要差异化的键:
type TaskStyle struct {
KVPairs map[string]string `json:"kvPairs"` // 仅记录与工程风格不同的部分
}
合并逻辑
finalStyle = merge(projectStyle.KVPairs, taskStyle.KVPairs)
任务同名键覆盖工程风格,由 PromptBuilder 节点在生成提示词时执行合并。
缓存层
cache/cache.go 提供应用内存级缓存,主要用于请求去重(详见 数据存储 — 去重策略):
- 数据结构:
sync.Map,key 为hash(prompt + assetType + params),value 为 taskId - 生命周期:任务提交时写入,任务完成或失败后清除;可设置 TTL 过期兜底
- 作用域:单实例内存,不跨实例共享
- 接口:提供
Get/Set/Delete/Clear方法,供 service 层(去重检查)调用