从 `.pt` 到 `.gguf`:彻底理解大模型权重格式与推理框架的关系

很多人刚接触大模型都会有一个疑问:
模型权重不是
.pt、.pth吗?为什么现在又冒出来.safetensors、.gguf、.engine?为什么同一个模型,必须使用不同的组件(Transformers、vLLM、Ollama、llama.cpp)来启动?底层不都是 PyTorch 吗?
本文将从 训练 → 导出 → 推理 的完整生命周期,带你彻底理解这些问题。

很多人刚接触大模型都会有一个疑问:
模型权重不是
.pt、.pth吗?为什么现在又冒出来.safetensors、.gguf、.engine?为什么同一个模型,必须使用不同的组件(Transformers、vLLM、Ollama、llama.cpp)来启动?底层不都是 PyTorch 吗?
本文将从 训练 → 导出 → 推理 的完整生命周期,带你彻底理解这些问题。

在经历了apifox的投毒事件以后,我就一直在寻找一个相对完美的替代品,终于我找到了一款叫yaak的开源神器!
关于apifox投毒事件可见:Apifox 供应链投毒攻击 — 完整技术分析

PageIndex是无向量模型依赖的RAG解决方案,通过推理模型将PDF或者markdown文档转换为JSON文件来实现检索
PDF/markdown转换为JSON有做开源(https://github.com/VectifyAI/PageIndex),但核心服务是闭源的,只能通过服务调用(sdk/http rest api/mcp http/mcp stdio)完成。
如果需要私有化部署需要单独联系采购
基于http的mcp不支持PDF/markdown转换为JSON。需要自己在后台页面中上传,操作较为繁琐
我上传了一份20+页的PDF,在后台看到的结果中只有2页。
因为无法直接上传我通过PageIndex生成好的json文件,只能使用云端默认的模型
就我自己本身的应用场景来看,目前基于向量模型的方案没有遇到瓶颈,暂不考虑PageIndex
另外PageIndex这个服务只是作者引流的一个开源仓库,实际服务与这个开源仓库关系不大

python + uv
1 | git clone https://github.com/oceanbase/awesome-oceanbase-mcp.git |
uv安装python依赖1 | cd awesome-oceanbase-mcp && \ |
claude命令添加MCP Server1 | claude mcp add-json oceanbase '{ |
1 | claude mcp list |
没有报错信息或者提示Connected即为成功
"type":"stdio"的声明暂无
需要安装好OpenClaw和Claude,并且配置相应的模型或者账号权限
/login我本地使用的Claude是使用litellm本地服务启动的,我有设置环境变量,是通过~/.zshrc文件维护。
OpenClaw一直报这个错,就是因为ta没有使用我的~/.zshrc文件
告诉OpenClaw尝试先执行source ~/.zshrc再调用Claude
OpenClaw在调用Claude时,不会使用Claude的交互模式,一般都是直接运行Claude -p "具体任务",而OpenClaw默认等待时间是60s左右,当你Claude超过这个时间响应时,就会导致OpenClaw因Claude超时失败
让OpenClaw异步调用Claude,把Claude输出的日志放到一个临时文件中,然后定时轮询这个临时文件查看日志即可