粟本偲
求职意向:AI Infra / AI 应用开发 / AI Agent / DevOps / SRE
23岁|
本科 · 闽南师范大学 · 软件工程|
2080981057@qq.com|
微信:17673157754|
GitHub: github.com/322dfs|
博客: blog.csdn.net/m0_74234518
教育经历
闽南师范大学 · 软件工程 · 本科
2022.09 - 2026.06
主修课程:计算机网络、操作系统、数据库原理、Python 程序设计、数据结构、计算机组成原理、Linux 系统管理等核心课程
在校期间自学 DevOps 工具链(Docker / Ansible / GitLab CI)与可观测化技术(Prometheus / Grafana / ELK),持续在 CSDN 输出技术博客
相关技能
1. AI Infra & Agent 平台开发 核心方向
DifyOdooLangChain
MCP 协议Function CallingRAG
向量化/切片OCROllama
Llama3DeepSeek飞书机器人
Cursor AgentTrae
从 0 到 1 搭建企业内网 AI 知识库平台(Dify + Odoo + 本地模型),覆盖"文档上传 → 自动同步 → 向量化入库 → 中文问答"完整 RAG 链路,数据全程不出内网;深入实践 MCP 协议、Function Calling、多步骤任务编排;基于 Ollama 部署本地大模型(Llama3 / DeepSeek)完成推理调优;补齐 OCR 流程解决扫描件检索问题;基于 Cursor Agent / Trae 等 AI Agent 工具实现半自动化部署与运维编排
2. AI 应用开发与协作工作流 AI 应用方向
PythonFlaskRESTful API
全栈开发Odoo 二次开发
CursorCursor AgentTrae
AI Agent 协同需求拆解架构设计
熟练使用 Python / Flask 搭建标准化 RESTful API,主导全栈应用开发与维护;具备 Odoo 二次开发经验(自研文档管理 + 自动同步模块);已建立成熟的 AI Agent 协同开发工作流——主导需求拆解、架构设计与异常排查,借助 Cursor / Trae 等 AI Agent 工具完成代码生成、服务器免密部署与流程自动化,开发周期缩短约 40%
3. 容器化与云原生 DevOps
DockerNamespaceCgroup
UnionFSDockerfile多阶段构建
镜像优化docker-composeKubernetes
Pod / DeploymentService / IngressHPA
HelmHarborGitLab CI
掌握 Docker 核心原理(Namespace / Cgroup 隔离、UnionFS 镜像分层),具备 Dockerfile 多阶段构建与镜像优化能力,熟练使用 docker-compose 编排多容器应用;正在系统学习 Kubernetes,已理解 Pod / Deployment / Service / ConfigMap 等核心资源与基本网络、存储概念(PV / PVC),目标在 3 个月内完成 K8s 部署 AI 推理服务的实战;已使用 GitLab CI 实践 CI/CD 流水线,了解 Helm Chart 与 Harbor 私有镜像仓库的基本概念(学习中)
4. 可观测性与监控告警 SRE
PrometheusGrafanaAlertmanager
告警规则监控大屏ELK
ElasticsearchKibanaKafka
KRaftFilebeatkafka-exporter
Celery + Redis
熟悉 Prometheus 指标采集、告警规则配置及 Grafana 可视化看板搭建,具备全量监控部署经验(含总览大屏 + 值班排障大屏 + 双语邮件告警);开源项目基于 Kafka + ELK 构建分布式日志可观测性平台——3 节点 KRaft 集群(acks=all / RF=3 / min ISR=2)、Filebeat 容器化采集(延迟≤10s)、Elasticsearch 全文检索存储、kafka-exporter 监控 Kafka 自身健康与 Consumer Lag、Celery + Redis 异步告警(4xx 邮件 / 5xx 邮件+钉钉双告警,响应延迟≤30s)
5. 自动化运维与中间件
AnsiblePlaybookNginx
反向代理负载均衡GitLab CI
阿里云备份快照MySQL
熟悉 Ansible 自动化运维工具,能编写 Playbook 实现批量配置管理;熟练配置 Nginx 反向代理、负载均衡及安全策略;具备 GitLab CI 流水线、阿里云等云原生平台使用经验;具备自动备份 + 历史快照 + 故障恢复机制设计经验
6. Linux 系统、网络与高可用架构
Linux 命令Shell 脚本性能调优
TCP/UDPHTTP/HTTPSiptables
VPN 组网SNAT/DNAT
KeepalivedMHA
Linux:常用命令、Shell 脚本、性能调优(top/vmstat/iostat)、日志管理、权限控制、文件系统
网络:OSI 七层模型,TCP/UDP、HTTP/HTTPS、DNS、DHCP 协议;iptables/firewalld 防火墙;SNAT/DNAT 原理;跨国网络故障排查
高可用:MySQL 主从复制(异步/半同步),Keepalived + 双 VIP + MHA 高可用数据库架构
工作经历
硅光芯片光电集成国家高新技术企业国产替代浙大上海高等研究院初创公司 · 一人多岗
运维开发实习生 → 主动放弃转正 | 电子/半导体/集成电路
- 工作内容一:网络运维——融入公司 IT 团队(主管 + 1 名正式员工 + 本人)参与日常网络运维与故障响应:办公网络问题(VPN 连接 / 内网访问 / DNS 解析 / IP 冲突等)、网络设备与防火墙规则日常维护,独立处理了多起网络工单;主导跨国组网方案落地(北美分公司访问上海总部内网),详见项目经历;参与公司内部小型网络变更实施
- 工作内容二:企业内网 AI 知识库平台建设(转正项目,AI 辅助开发)——为完成转正目标与争取留用,自学 AI 知识并基于运维开发基础,借助 Cursor / Trae 等 AI Agent 工具从 0 到 1 搭建企业内网 AI 知识库平台:Dify + Odoo + 本地模型,覆盖"文档上传 → 自动同步 → 向量化入库 → 中文问答"完整 RAG 链路,数据全程不出内网。初版单机部署稳定性不足,主导设计三套同构环境(A/B/C 集群)高可用架构(约 30 个容器、两台服务器);自研"文档中心 + 自动同步"两个模块实现 Odoo 上传后自动同步至 Dify 问答库;AI 推理使用公司本地模型服务器(Llama3 / DeepSeek);部署 Prometheus + Grafana + Alertmanager 监控告警体系(总览大屏 + 值班排障大屏 + 双语邮件告警);完成故障切换演练。解决三个难题:初版稳定性不足(推翻重建)、多人登录账号串联(修复会话隔离)、PDF 扫描件无法检索(补齐 OCR 流程)。成果:平台已验收通过并交付使用,48 篇 ECTC 2026 CPO/NPO 论文入库验证(支持中文提问检索英文论文),配套监控/备份/运维文档齐全,项目周期一个月(4/8-5/5)
- 参与:Proxmox VE 高可用集群 PoC——因 VMware 授权策略调整且合规要求,公司启动 PVE 国产化替代验证。参与 IT 团队(3-4 人)PVE 集群部署工作,承担部分配置与故障切换测试任务,对架构设计有大致理解(深度仍在学习中);集群采用 Ceph 分布式存储,强制关闭节点验证 VM 自动迁移,输出《PVE 高可用部署与故障测试手册》并录入团队 Odoo 知识库。验证开源方案可行性,单集群每年可节省约 12 万元 CPU 授权费,为后续 10+ 节点生产环境迁移奠定基础
导师评价:"实习成果超出预期,建议留用"——获转正机会后,基于清晰的行业判断主动放弃转正:公司芯片研发为业务核心、IT 部门定位边缘、薪资缺乏竞争力、行业天花板有限,已建立 "网络运维功底 + AI 应用实战" 复合能力栈,目标是 AI 创业公司的 AI Infra 岗位
中国移动合作无纸化签约湖南全省高校国家级专精特新"小巨人"
运维实习生(IT 服务)| 职场入门期,以学习融入为主
- 业务背景:作为中国移动合作的无纸化签约平台的运维方之一,负责保障湖南省内高校秋季开学季校园办卡业务的后台系统稳定——7 月中旬至 9 月中旬为业务高峰保障期(覆盖新生入学办卡、电子签约、号卡激活全链路)
- 业务高峰值守:8 月底办卡峰值期间连续多日 7:00 - 21:00 在岗值守,紧盯系统监控与应急响应,保障办卡流程与无纸化签约链路稳定,高峰期零业务中断
- 日常基础运维:负责测试/生产环境日常巡检(系统进程、磁盘水位、服务状态、日志审查)、告警响应与基础故障排查;跟随导师学习企业级生产环境的运维规范与发布流程
- 主动学习 + 偷学本领:利用自习时间在测试环境自建 Nginx + Keepalived + NFS 高可用 Web 集群,从零理解 VIP 漂移机制(实测漂移耗时 ≤10s)、NFS 共享存储、Keepalived 心跳检测原理——为后续独立承担 PVE 集群与跨国组网项目打下高可用架构基础
- 文档沉淀:整理巡检 SOP、故障排查笔记,输出《Nginx + Keepalived + NFS 高可用集群部署实践》手册 1 份
↓ 业务高峰保障经验沉淀后,于 2025.12 加入上海孛璞半导体(初创公司),开启一人多岗的探索期
项目经历
基于 WireGuard + Phantun + Docker 的跨国企业组网方案 上海孛璞半导体 · 主导方案设计与全流程落地
2025.12 - 2026.06 | 工作产出,详细技术方案
- 背景与痛点:北美分公司需频繁访问上海总部内网(光模块测试硬件、研发数据服务器),原商业 VPN 因 UDP 被运营商深度封杀,连通率不足 50%,且与企业 FortiGate 防火墙、Docker 容器化部署规范不兼容
- 技术方案:采用 WireGuard(加密隧道) + Phantun(UDP→TCP 协议转换) + Docker(双容器共享网络命名空间,零损耗转发) + FortiGate(防火墙源地址白名单) 的架构。关键设计:TCP 443 伪装利用 HTTPS 端口"免检"特性规避 UDP 封杀;MTU 优化(1400)避免公网 IP 分片丢包;最小权限(容器仅授予 NET_ADMIN 和 SYS_MODULE,不使用 --privileged)
- 方案迭代:6 轮渐进式迭代——从 MT3000 路由器原型验证,到 Docker 容器化转型,再到最终的双容器 TCP 封装方案;通过前 4 轮失败认识到"问题不在工具,在协议",果断从 UDP 优化转向 TCP 封装,体现"先验证核心假设,再做工程实现"的方法论
- 测试体系:设计并执行三级测试——上海内网功能验证 → 模拟北美外网 72 小时压力测试 → 北美真实环境生产验证,确保方案可靠性
- 成果:连通率 50% → 100%,跨网延迟稳定在 45-60ms,丢包率 ≤0.05%,7×24h 无断连,故障恢复时间 ≤30s(容器自启),相比商业 VPN 年省约 8 万元 授权费;输出 3 份标准化文档(部署手册 / 排查手册 / 架构设计),通过公司 IT 安全审计
- 替代方案对比:调研 Tailscale 方案(部署更简单),但因其控制面在境外不符合公司数据链路完全可控的安全要求,最终未采用——展示不同技术方案间的权衡能力
基于 Kafka + ELK 的分布式日志可观测性平台 个人学习项目 · 主导架构设计,AI Agent 辅助落地
2024.12 - 至今 | 项目地址:gitcode.com/SUBENCAI/kafka-observability-stack
- 架构设计:采用"Kafka broker on VM + 采集/消费/存储层容器化"混合部署——3 节点 Kafka KRaft 集群(无 ZooKeeper)部署于 VM 保障磁盘 IO 性能,Filebeat / Elasticsearch / Kibana 容器化部署;接入 Nginx、Flask、系统日志等多源数据
- 消息可靠性:Kafka 配置分区副本 RF=3、min.insync.replicas=2、acks=all,保障消息不丢失;多 topic 分流(access / error / system),日志保留 7 天 / 10GB;Filebeat 采集结构化 JSON,采集延迟 ≤10s
- 消费与存储:Python 消费者组多分区并行消费,批量写入 Elasticsearch(支持全文检索 + 聚合分析),存储效率提升 40%;Kibana 搭建日志看板,支持按时段 / 状态码 / 服务名多维检索
- Kafka 自身监控:使用 kafka-exporter 监控 Consumer Lag 与 broker 健康度,Grafana 搭建集群健康大屏;磁盘水位 >80% / Consumer Lag 异常时触发告警
- 业务告警:Celery + Redis 异步告警——4xx 触发邮件告警,5xx 触发邮件+钉钉双告警,响应延迟 ≤30s;故障定位效率提升 70%
- 成果:5xx 告警准确率 100%;单节点资源占用低(CPU ≤10% / 内存 ≤2GB);输出 2 份标准化手册(部署 + 故障排查),已开源至 GitCode
自我评价
- 行业判断与方向选择:基于对半导体公司 IT 部门定位边缘、薪资缺乏竞争力、行业天花板有限等清晰认知,主动放弃转正,坚定走上 AI 方向;目标聚焦 AI 创业公司的 AI Infra / AI 应用开发 / AI Agent 岗位,已建立从 LLM 应用(Dify / RAG / Agent)到本地模型部署、跨国组网的完整技术栈
- 复合能力栈(运维 + AI):具备扎实的网络运维功底(融入 IT 团队参与日常运维、独立处理多起网络工单 + 主导跨国组网方案落地)+ AI 应用实战(从 0 到 1 搭建企业内网知识库平台、验收通过、交付使用)+ AI Agent 协同(Cursor 规划 + Agent 执行 + 人工验证工作流),三者形成 1+1+1>3 的复合优势,正中 AI 创业公司"懂运维又懂 AI"的招聘画像
- 工程化思维:所有项目均有量化产出(知识库平台 48 篇 ECTC 2026 论文入库验证、跨国组网连通率 100%、PVE + WireGuard 两个项目合计年省约 20 万授权费),习惯输出标准化文档与知识库沉淀,CSDN 持续输出技术内容