秦洋 / Bob

Agentic Engineering Multimodality AIGC

"Don't be afraid, be passionate!"

趣丸科技
多模态 · Agent · 高级算法工程师 · 2025.08 - 2026.08
光魔科技
AIGC · 算法工程师 · 2024.06 - 2025.08
澳门科技大学
理学硕士 · 应用数学与数据科学
佛山大学
工学学士 · 数据科学与大数据技术
SCROLL
光

光魔科技(深圳)有限公司

白日梦AI/MagicLightAI · 算法工程师 · 2024.06 - 2025.08

AIGC产品全流程研发

参与海内外 AI 长视频生成产品全流程算法研发,覆盖 文本 → 图像 → 视频 全链路,深入理解 AIGC 业务流与算法落地。

LLM 效果与成本优化

重构故事 to 剧本的 LLM 流程;优化影视内容提示词工程,提升连续性与相关性;调用成本降低 40%;优化适配 FLUX 的提示词扩写,解决角色融合与动作瑕疵。

人脸一致性 / 换脸

从零构建人脸处理模块:人物重定位 + InstantID / PuLID 一致性 + 人脸融合,达到消费级图像质量。

图像区域控制

基于 Kolors 实现 Attention 层区域隔离 + IPAdapter,实现生成内容与人物的区域控制。

软硬结合的区域控制

Inpainting + Pose + IPAdapter 方案,缓解区域间干扰,减少人物动作畸形。

人物对口型

Audio2Lips + FaceDriven 融合方案,短耗时低开销,提升人脸动态效果与对口型精准度。

图生视频 / 动作驱动

实操各类开源视频模型的优化与部署;负责闭源模型的对接与评测,熟悉各类动作驱动视频模型。

趣

广州趣丸网络科技有限公司

All Voice Lab 事业部 · 高级算法工程师 · 2025.08 - 2026.08

视频翻译与多模态内容感知

深度参与视频翻译场景下的多模态算法工作。

视频字幕 OCR

  • 传统 OCR:优化前后处理与难样本训练,效果提升至 98%,性能提升 85%。
  • VLM-based OCR:准确率达 99%+、性能达 80IPS;构建含 3 类指标、15 个模型的 Benchmark。
  • AutoResearch:探索模型选型、推理引擎与 Pipeline 设计的速度优化最佳实践。

多模态说话人分割

V1: 3D-Speaker + 唇动检测 + 人脸追踪 + 改进聚类,相对纯声纹提升 10 个点;
V2: 多模态大模型匹配(ASR + OCR + 多轮对话 + 全局角色管理);
V3: 基于 Qwen3-Omni 进行说话人分离 SFT,构造 5w 条数据进行 LoRA 训练,整体效果提升 6%。

多模态影视数据理解

基于 Gemini 为长视频(2h+)做细粒度多维度数据理解,覆盖 对话、场景、镜头、角色 等类别,支撑下游模型训练。

Agent 探索与应用

重度使用与探索 Agent 产品与技术;从 0 到 1 构建垂类 Agent 系统。

Agent 系统优化

  • 构建分层分级、自然学习与衰退的 记忆系统,节省 80% 记忆 token 加载
  • 优化 compact 机制,提升长任务的可持续性与上下文知识沉淀
  • 构建个性化 skill,初始化并持续优化 Agent 行为风格与用户画像

智能营销 Agent

  • 构建 通用 + 业务双流 Agent 系统,并行协同 ReAct 与 Graph-execution 范式
  • 基于 LangGraph 构建 Agentic Graph,动态编排业务图,提升流程灵活性与执行厚度

期待与团队一起探索AI领域的边界