"Don't be afraid, be passionate!"
白日梦AI/MagicLightAI · 算法工程师 · 2024.06 - 2025.08
参与海内外 AI 长视频生成产品全流程算法研发,覆盖 文本 → 图像 → 视频 全链路,深入理解 AIGC 业务流与算法落地。
重构故事 to 剧本的 LLM 流程;优化影视内容提示词工程,提升连续性与相关性;调用成本降低 40%;优化适配 FLUX 的提示词扩写,解决角色融合与动作瑕疵。
从零构建人脸处理模块:人物重定位 + InstantID / PuLID 一致性 + 人脸融合,达到消费级图像质量。
基于 Kolors 实现 Attention 层区域隔离 + IPAdapter,实现生成内容与人物的区域控制。
Inpainting + Pose + IPAdapter 方案,缓解区域间干扰,减少人物动作畸形。
Audio2Lips + FaceDriven 融合方案,短耗时低开销,提升人脸动态效果与对口型精准度。
实操各类开源视频模型的优化与部署;负责闭源模型的对接与评测,熟悉各类动作驱动视频模型。
All Voice Lab 事业部 · 高级算法工程师 · 2025.08 - 2026.08
深度参与视频翻译场景下的多模态算法工作。
V1: 3D-Speaker + 唇动检测 + 人脸追踪 + 改进聚类,相对纯声纹提升 10 个点;
V2: 多模态大模型匹配(ASR + OCR + 多轮对话 + 全局角色管理);
V3: 基于 Qwen3-Omni 进行说话人分离 SFT,构造 5w 条数据进行 LoRA 训练,整体效果提升 6%。
基于 Gemini 为长视频(2h+)做细粒度多维度数据理解,覆盖 对话、场景、镜头、角色 等类别,支撑下游模型训练。
重度使用与探索 Agent 产品与技术;从 0 到 1 构建垂类 Agent 系统。
期待与团队一起探索AI领域的边界