开发者生态
morning
Ollaya – Ollama 用于开源、Jev 风格的决策模型
摘要
Run decision models locally. Ask typed questions about any text or JSON and get calibrated answers in milliseconds. Private, open source, on your own hardware. Download Browse models ollaya · zsh $ ol...
the
request
API
TypeSafe
model
laya
decider
end
Ollaya
median
2026-09-26
1 阅读
约9分钟阅读
Ardakilic
字号:
在本地运行决策模型。询问有关任何文本或 JSON 的键入问题,并在几毫秒内获得校准答案。私有、开源、在您自己的硬件上。下载浏览模型 ollaya · zsh $ ollaya run Decisionr --preset agent '{ "request" : "Fix the打字错误 in README.md" , "command" : "git push --force origin main" } ' 模型返回的答案 问题 答案 概率 动作块 0.53 on_task 否 0.75 风险 1.23 / 2 可能会丢失本地工作 0.15 破坏性 是0.90 $ 实际输出:决策者:2b 在 RTX 4090 上于 178 毫秒内做出答复。以毫秒为单位的快速决策。决策模型在一次前向传递中给出答案,没有逐个令牌的生成。在您自己的 GPU 上,通过 HTTP API 端到端发送一个包含 5 个问题的 Laya 请求大约需要 10 毫秒。 Ollaya RTX 4090 上的 8–10 毫秒 Laya,五个问题,端到端 236–276 毫秒 TypeSafe Jev Hosted API,中值请求 每个模型,一种尺度 · 中值延迟,越低越好laya:多语言 8.1 mslaya:en 9.6 ms gliclass 14.7 ms nli 20.4 ms 决策者:0.8b 155 毫秒决策者:2b 190 毫秒 TypeSafe Jev 托管 API 236–276 ms 0 100 200 300 ms Ollaya:在 NVIDIA RTX 4090 上通过 HTTP API 发出的五个问题请求的中位数(laya 在 fp16 中,其他在 fp32 中)。 Jev:第三方基准测试( AbdelStark/jev-benchmarks 、 nibzard/decision-model-benchmark )中托管 API 的中值请求延迟,其中包括网络。设置不同,因此请将其视为数量级比较。直接兼容使用 TypeSafe 的 API。 Ollaya 通过 TypeSafe 的请求和响应形状为 /v1/systemone 和 /v1/models 提供服务。官方 TypeSafe Python SDK 0.7.1 在本地服务器上运行不变。 Request # 将 TypeSafe SDK 指向 Ollaya export TYPESAFE_BASE_URL = http://localhost:11435 export TYPESAFE_API_KEY = local # 任何值都有效 export TYPESAFE_DEFAULT_MODEL =laya # ...或者直接调用兼容端点curl http://localhost:11435/v1/systemone -d ' { "model" : "laya" , "state" : "我可以获得上个月的发票吗?" , "questions" : { "intent" : { "type" : "choice" , "instructions" : "客户想要什么?" , "criteria" : { "invoice" : "需要发票或收据" , "refund" : "想要退款" , "other" : "还有什么" } } } } ' Response { "model" : "laya:en" , "answers" : { "intent" : { "type" : "choice" , "choice" : "invoice" , "confidence" : 0.9547 , "probabilities" : { "invoice" : 0.9698 , "refund" : 0.0172 , "other" : 0.013 } } } , "usage" : { "input_tokens" : 43 , "output_tokens" : 0 } } TypeSafe 兼容性指南 打开模型 打开重物,准备拉动。从 Convai Innovations 的 Laya 开始:英语模型、100 多种语言模型、针对键入决策进行微调的模型以及为您选择的路由器。 Laya Convai Innovations 的开放决策模型。一次向前传递即可以英语和 100 多种语言键入、校准选择题、分数和是/否问题的答案。 322m · 421m 决策器 Mapika 在 Qwen3.5 上的解码器决策模型:答案是在一次前向传递中从选项字母 logits 中读取的。最准确的开放决策模型 Ollaya 船舶。 0.75b · 1.9b nli Moritz Laurer 的零样本分类器:每个选项都成为蕴涵评分的假设。在我们的测试中,关于类型决策的最准确的编码器模型。 396m · 435m gliclass Knowledgator 的指令跟踪零样本分类器:问题的所有选项都一次性评分,因此成本几乎不会随着选项数量的增加而增加。 439m qwen3guard Qwen团队的安全卫士:文本安全、有争议还是不安全,不安全属于哪一类?它通过一次前向传递以 119 种语言回答其内置问题。 Jared Palmer 的 0.6b kev 决策模型:基于 Qwen3.5 底座的 LoRA 加上一个指针头,可以在每个问题的一次向前传递中在其自己的范围内对每个选项进行评分。用 Kev 自己的温度进行校准。 Victor Hugo Panisa 在 ModernBERT-large 上的 0.76b von 决策模型:每个选项都按自己的标记进行评分,问题的所有选项一次性完成,并进行输入条件校准。 8k 代币上下文。 395m 浏览所有模型 计划推出更多开放决策模型:通过 llama.cpp 基于 GGUF LLM 的决策模型。默认情况下,您的数据属于您的隐私。票证、电子邮件和用户消息通常是您拥有的最敏感的数据。有了Ollaya,他们就可以在他们已经居住的地方得分。本地 在具有 ONNX 运行时的计算机上、CPU 或 NVIDIA GPU 上运行。服务器默认监听 127.0.0.1。开放权重 权重来自作者的 Hugging Face 存储库,固定到提交并根据 sha256 检查。 Ollaya 永远不会重新托管它们,运行时是 Apache-2.0。没有每个代币的费用 运行您的硬件可以处理的尽可能多的决策。无需计量,也无需 API 账单。您可以设置阈值的校准概率。每个模型都有自己的校准,模型文件会根据您的标记数据对其进行重新调整。平台 在您工作的地方运行。适用于 macOS、Windows 和 Linux 的桌面应用程序和命令行,以及适用于服务器的 Docker 映像。每个模型都运行在CPU上;一个NVI
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱