MLX · APPLE SILICON · OPEN WEIGHTS

Laya-MLX

在 Apple Silicon 上本地运行开放权重的结构化决策模型。原生 MLX 推理,无 PyTorch / Transformers 依赖,无云端 API。

GitHub 仓库 Hugging Face 权重 完整 Benchmark
13.4 ms
Laya 421M 单问题 P50
7.4 ms
Multilingual 322M 单问题 P50
0
输出 Token(分类概率直出)
378 / 378
FP32/FP16 移植一致性验证

项目简介

Laya-MLX 是 Laya 结构化决策模型的独立 MLX 移植版:choice 返回分类概率,score 返回有序评分,noul 返回 P(true)。每个问题作为独立行经过双向编码器,端到端延迟在毫秒级。

原生 MLX,极致轻量单个短问题端到端中位仅 13.4 ms(multilingual 7.4 ms),零输出 token。
🔒
完全本地推理无云端 API、无 PyTorch / Transformers 推理依赖,权重一次下载后离线可用。
🌏
多语言支持multilingual 检查点(mmBERT-base)支持中文等非英语输入,最大上下文 1,024。
🐍
贪吃蛇演示内置 laya-snake 终端游戏,每一步调用 Laya 决策,展示安全层接管与路由。

M3 Max 实测(FP16)

硬件:M3 Max(40 核 GPU、128 GiB 内存)。计时包含提示准备、tokenization、张量构建、GPU 同步推理与校准。

端到端指标Laya 421MMultilingual 322M
单个短问题 P5013.42 ms7.39 ms
单个短问题 P9513.92 ms7.79 ms
50 问题吞吐量146.8 q/s395.0 q/s
MLX 峰值分配943.6 MiB687.6 MiB

快速开始

# 安装
pip install laya-mlx

# 贪吃蛇演示
pip install 'laya-mlx[demo]'
hf download aac6fef/laya-multilingual-mlx
laya-snake
import laya_mlx as laya

agent = laya.load("aac6fef/laya-multilingual-mlx")
result = agent.predict(
    "发票被重复扣款,请退款。",
    {"department": {
        "type": "choice",
        "criteria": ["billing", "technical", "sales"],
    }},
)
print(result["answers"]["department"])

支持的检查点

检查点编码器参数量最大上下文
convaiinnovations/layaModernBERT-large421M512
convaiinnovations/laya-multilingualmmBERT-base322M1,024
convaiinnovations/laya-typed-decisionsModernBERT-large421M1,024

关于本页面的重要说明

为什么这里不能直接运行模型推理?
Laya-MLX 依赖 Apple 的 MLX 框架,而 MLX 仅支持 Apple Silicon(macOS)上的 Metal GPU。Hugging Face Space 运行在 Linux 服务器上,无法安装 MLX,因此模型推理无法在此环境中运行。

如需真实体验推理效果,请在 Apple Silicon Mac 上执行:pip install laya-mlx,随后参考上方快速开始代码。本页面为项目的介绍与展示页。