关于
我是 Yuhuan,一个对人工智能领域充满兴趣的大学生。
我在 AI 领域的实践从 Dataset、LLM 基座模型、Inference Infra、API 聚合平台,一路延伸到 AI Agent 与 AI News 等应用。在其他领域,我也拥有 macOS 应用的开发经历、前端网站的设计,以及 Minecraft 服务器的搭建经历与 Discord Bot 的基础经验。
相较于构建出赢过别人、精美的 Demo,或是易于变现的产品,我更希望做出能对社区产生贡献的项目,以及解决实际问题的应用。
技术能力
编程语言
Python・TypeScript・Swift・C/C++・SQL・Shell
机器学习
PyTorch・Transformers・Apple MLX
数据工程
Hugging Face Datasets・pandas・NumPy・PyArrow
网站开发
Next.js・React・Tailwind CSS・Radix UI・Framer Motion・MDX
后端与 API
FastAPI・SQLAlchemy・PostgreSQL・MongoDB・Redis・MinIO・WebSockets
基础设施
Docker・GitHub Actions・GHCR・Trivy・Ubuntu・Cloudflare・uv・pnpm
macOS 应用
Swift・SwiftUI・Core Audio・Core ML
数字内容
Unreal Engine・Unity・DaVinci Resolve・Premiere Pro
经历
YuhuanStudio
Founder
- ModelYunmo v0・Yunmo v0.1・Yunmo V1・Yunmo-Next
- InferenceYunshu
- DatasetWikiZH_Dataset・+17 more
- ApplicationYunmo・Yunxin・YunNEWS・YunAudio・Guizhong
- WebsiteYunUI・YuhuanStudio Official
学历
元智大学 电机工程学系乙组
学士班
国立中央大学附属中坜高级中学
75th
项目
- YunAudiomacOS 音频路由器,自带虚拟音频设备,整条信号路径可证明位精确。
- YunNEWS每天把全球 AI 动态整理成中文摘要,每条附原始出处。
- YunAgent通用 Agent 工作台,LLM/Plan/Agent 三种模式共用同一套 durable runtime:事件、checkpoint、pause/resume/replay、MCP 工具。
- YunshuApple Silicon 上的高速本地多模态(omni)推理引擎,通过 Qwen3-Omni 原生流式语音对语音。文本、视觉、音频、图像与 embedding 全部跑在 MLX 上。
- YunUI一套不喧哗的 React 19 + Tailwind v4 设计系统。令牌驱动、三套主题、与框架无关的适配层——每个细节都被在意过,却没有一个在喧哗。
- Yunmo-Next从零预训练中文语言模型,基于 GQA + Kimi Delta Attention 混合架构,靠逐层成长把 0.44B 推到 1.01B 参数、原生上下文推到 32K。
- Yunxin将 24+ LLM 供应商聚合在单一 API 之后的统一网关,支持 Chat Completions API、Responses API 与 Messages API。一组 API key,所有模型。
- Yunmo一个持续存在的数字个体——有自己的时间感、情绪边界、和不依赖任何人的内在生命。基于 LinOSS 与 8 维情绪向量,让计算产生真正值得被称为「陪伴」的东西。
- WikiZH_Dataset维基百科中文语料处理工具,用于生成预训练与多模态数据集,一次解析同时产出纯文本、图文交错与图文配对三种形态。
- Yunmo V1基于 minimind 架构从零预训练的繁体中文小型语言模型,v0 到 v1。
- AI-Friend一个本地运行的 AI 聊天角色,基于 LangChain、Ollama、ChatTTS,并可接入 VTube Studio 驱动角色。
- Guizhong功能丰富的 Discord 机器人,涵盖音乐、AI 集成、抽奖等。
模型与数据集
Yunmo-V1模型
基于 MiniMind v3(Qwen3 架构:RMSNorm、SwiGLU、RoPE、GQA、QK-Norm)从零预训练,层数 8 → 24、词表换成 24,000 的繁体特化分词器。
195M · 24 层 · 768 hidden · 8 heads / 4 KV · 24k 词表 · RoPE 32k50次下载
Yunmo v0.1模型
基于 MiniMind v2 从零预训练,词表换成 25,600 的繁体特化分词器。
0.1B · 16 层 · 768 hidden · 25.6k 词表 · RoPE 32k需申请访问
Yunmo v0模型
基于 MiniMind v2 从零预训练,沿用上游的 6,400 词表。
0.1B · 16 层 · 768 hidden · 6.4k 词表 · RoPE 2k需申请访问
wikipedia-zh / zh-tw数据集
中文维基百科纯文本语料,一个条目一条并保留章节结构,可直接用于预训练。
繁体+简体 · 各 148 万条850次下载13个收藏
wikipedia-omni-zh / zh-tw数据集
图文交错版维基语料,格式对齐 MMC4 与 OBELICS 的惯例。
繁体+简体 · 各 148 万条159次下载
wikipedia-image-zh-tw数据集
维基百科图片,一图一条,附图说、替代文字与所在条目章节。
183 万条70次下载1个收藏