AI工作站

AI开发助手 GPT工具模型阿里QwenAI模型广场AI推理模型MoE大模型 FreeToken系统通过全层双缓冲、带宽自适应混合调度、Agent状态复用及弹性显存热扩缩容等技术,将个人电脑的CPU、内存、PCIe与GPU统一为弹性计算平台。
爱站权重:爱站爱站爱站爱站爱站
创建快捷到桌面设置为浏览器首页或按 Ctrl+D 收藏本页到浏览器收藏夹回家不迷路!

FreeToken是UC Berkeley与MIT等机构联合开源的端侧MoE大模型推理系统。系统通过全层双缓冲、带宽自适应混合调度、Agent状态复用及弹性显存热扩缩容等技术,将个人电脑的CPU、内存、PCIe与GPU统一为弹性计算平台,实现单卡消费级硬件满血运行Qwen3.6-35B、DeepSeek-V4-Flash 284B等超大MoE模型,让本地部署顶尖AI成为现实。

FreeToken官网插图

一、产品核心功能:

1、端侧满血推理

支持在RTX 4060/5090等消费级单卡上满血运行Qwen3.6-35B、DeepSeek-V4-Flash 284B等超大MoE模型。

2、全层双缓冲预取

GPU计算当前层时,后台通过PCIe流式预取下一层Expert权重,彻底消除I/O等待气泡。

3、带宽自适应调度

实时探测PCIe带宽与CPU算力,动态分流未命中Expert至GPU缓存或CPU就地计算,拉到硬件吞吐极限。

4、Agent状态复用

在特殊Token边界设置轻量检查点,上下文编辑时仅从最近锚点增量Prefill,避免重复计算完整历史。

5、弹性显存热扩缩

后台应用抢占显存时,无缝收缩GPU Cache并转交CPU计算,实现0停机、不OOM的平滑降级。

6、极速低延迟

首Token延迟降低42–58%,Agent多轮交互TTFT减少65–80%,整体比Ollama快2–4倍。

二、产品核心优势:

1、打破硬件门槛

消费级单卡(如RTX 4060/5090)即可满血运行35B–753B参数的超大MoE模型,无需数据中心集群。

2、推理速度领先

比Ollama快2–4倍,比llama.cpp快1.46倍,笔记本RTX 4060跑Qwen3.6-35B可达39.3 tok/s。

3、首Token延迟极低

通过全层双缓冲与带宽自适应调度,将长Prompt的TTFT降低42–58%。

4、Agent交互优化

基于Token边界轻量检查点与状态复用,多轮工具调用场景的TTFT减少65–80%。

5、弹性显存不崩溃

后台应用抢占显存时,可热扩缩GPU Cache并转交CPU计算,实现0停机、不OOM的平滑降级。

6、全栈异构协同

将CPU、系统内存、PCIe总线与GPU统一为弹性推理平台,自动收敛至硬件拓扑的理论最大吞吐。

三、标准使用流程:

1、桌面App安装

访问FreeToken官网https://www.flashml.ai/ 下载Windows或Linux桌面App,安装后通过GUI界面即可启动推理服务。

2、命令行快速安装

通过命令行执行uv pip install "freetoken[accel]" 一键完成CLI工具的安装。

3、模型载入与自动调度

载入支持的MoE模型权重,系统会自动完成CPU-GPU异构调度与带宽自适应配置。

4、硬件配置建议

运行DeepSeek-V4-Flash等超大模型时,建议配备32GB显存并搭配192GB以上内存保证稳定流畅。

5、弹性显存自动管理

使用过程中若后台有游戏或渲染抢占显存,FreeToken会自动热扩缩容,无需手动干预或重启服务。

数据统计