项目简介
Laya-MLX 是 Laya 结构化决策模型的独立 MLX 移植版:choice 返回分类概率,score 返回有序评分,noul 返回 P(true)。每个问题作为独立行经过双向编码器,端到端延迟在毫秒级。
⚡
原生 MLX,极致轻量单个短问题端到端中位仅 13.4 ms(multilingual 7.4 ms),零输出 token。
🔒
完全本地推理无云端 API、无 PyTorch / Transformers 推理依赖,权重一次下载后离线可用。
🌏
多语言支持multilingual 检查点(mmBERT-base)支持中文等非英语输入,最大上下文 1,024。
🐍
贪吃蛇演示内置 laya-snake 终端游戏,每一步调用 Laya 决策,展示安全层接管与路由。
M3 Max 实测(FP16)
硬件:M3 Max(40 核 GPU、128 GiB 内存)。计时包含提示准备、tokenization、张量构建、GPU 同步推理与校准。
| 端到端指标 | Laya 421M | Multilingual 322M |
|---|---|---|
| 单个短问题 P50 | 13.42 ms | 7.39 ms |
| 单个短问题 P95 | 13.92 ms | 7.79 ms |
| 50 问题吞吐量 | 146.8 q/s | 395.0 q/s |
| MLX 峰值分配 | 943.6 MiB | 687.6 MiB |
快速开始
# 安装 pip install laya-mlx # 贪吃蛇演示 pip install 'laya-mlx[demo]' hf download aac6fef/laya-multilingual-mlx laya-snake
import laya_mlx as laya agent = laya.load("aac6fef/laya-multilingual-mlx") result = agent.predict( "发票被重复扣款,请退款。", {"department": { "type": "choice", "criteria": ["billing", "technical", "sales"], }}, ) print(result["answers"]["department"])
支持的检查点
| 检查点 | 编码器 | 参数量 | 最大上下文 |
|---|---|---|---|
| convaiinnovations/laya | ModernBERT-large | 421M | 512 |
| convaiinnovations/laya-multilingual | mmBERT-base | 322M | 1,024 |
| convaiinnovations/laya-typed-decisions | ModernBERT-large | 421M | 1,024 |
关于本页面的重要说明
为什么这里不能直接运行模型推理?
Laya-MLX 依赖 Apple 的 MLX 框架,而 MLX 仅支持 Apple Silicon(macOS)上的 Metal GPU。Hugging Face Space 运行在 Linux 服务器上,无法安装 MLX,因此模型推理无法在此环境中运行。
如需真实体验推理效果,请在 Apple Silicon Mac 上执行:
Laya-MLX 依赖 Apple 的 MLX 框架,而 MLX 仅支持 Apple Silicon(macOS)上的 Metal GPU。Hugging Face Space 运行在 Linux 服务器上,无法安装 MLX,因此模型推理无法在此环境中运行。
如需真实体验推理效果,请在 Apple Silicon Mac 上执行:
pip install laya-mlx,随后参考上方快速开始代码。本页面为项目的介绍与展示页。