跳到正文
原文
Hugging Face:Blog(RSS)·· 2021-06-28精选AI 评分70

Hugging Face Hub 集成 Sentence Transformers,上线句子嵌入与相似度组件

Sentence Transformers in the Hugging Face Hub

AI 导读

Hugging Face 宣布 Hub 集成 Sentence Transformers v2,Hub 上已有超过 90 个预训练模型、覆盖 100 多种语言。新增 feature-extraction 和句子相似度两个组件,并提供 Inference API 端点;用户可用 model.save_to_hub 一键分享模型,自动生成模型卡并按标签筛选发现模型。

推荐理由

官方介绍了 Sentence Transformers v2 与 Hub 的集成方式,读者可据此了解模型分享、演示组件和 API 的实际用法。

正文 · AI 翻译

在过去的一段时间里,我们与机器学习生态系统中的许多开源框架建立了合作关系。其中让我们特别关注的是 Sentence Transformers。

Sentence Transformers 是一个用于句子、段落和图像的框架。它能够生成语义上有意义的嵌入,这对于语义搜索或多语言零样本分类等应用非常有用。随着 Sentence Transformers v2 版本的发布,带来了许多很酷的新功能:

在 Hub 中拥有超过 100 种语言的预训练 Sentence Transformers 模型,任何人都可以从中受益并轻松使用它们。预训练模型只需几行代码即可直接加载和使用:

但不仅如此。人们可能希望展示他们的模型或轻松尝试其他模型,因此我们很高兴地宣布在 Hub 中发布两个新的小部件!第一个是 feature-extraction 小部件,它展示了句子嵌入。

sentence-transformers/distilbert-base-nli-max-tokens

托管推理 API

特征提取

该模型当前已加载并在推理 API 上运行。

但看到一堆数字可能对你来说并不是很有用(除非你能一眼就理解这些嵌入,那将令人印象深刻!)。我们还为 Sentence Transformers 的一个常见用例引入了一个新的小部件:计算句子相似度。

当然,除了这些小部件之外,我们还在推理 API 中提供了 API 端点,你可以使用它们以编程方式调用你的模型!

import json
import requests

API_URL = "https://api-inference.huggingface.co/models/sentence-transformers/paraphrase-MiniLM-L6-v2"
headers = {"Authorization": "Bearer YOUR_TOKEN"}

def query(payload):
    response = requests.post(API_URL, headers=headers, json=payload)
    return response.json()

data = query(
    {
        "inputs": {
            "source_sentence": "That is a happy person",
            "sentences": [
                "That is a happy dog",
                "That is a very happy person",
                "Today is a sunny day"
            ]
        }
    }
)

释放分享的力量

那么为什么这很强大呢?在几分钟内,你就可以将训练好的模型分享给整个社区。

from sentence_transformers import SentenceTransformer

# Load or train a model

model.save_to_hub("my_new_model")

现在你将在 Hub 中拥有一个仓库来托管你的模型。一个模型卡片会自动创建。它通过列出层来描述架构,并展示如何同时使用 Sentence Transformers 和 🤗 Transformers 来使用该模型。你还可以立即试用小部件并使用推理 API!

如果这还不够令人兴奋,你的模型还可以通过筛选所有 Sentence Transformers 模型轻松被发现。

接下来是什么?

展望未来,我们希望使这种集成更加有用。在我们的路线图中,我们期望训练和评估数据能够包含在自动创建的模型卡片中,就像 transformers 从版本 v4.8 开始的情况一样。

那么你的下一步是什么?我们非常期待看到你的贡献!如果你已经在 Hub 中有一个 Sentence Transformer 仓库,你现在可以通过更改模型卡片元数据来启用小部件和推理 API。

---
tags:
  - sentence-transformers
  - sentence-similarity # Or feature-extraction!
---

如果你在 Hub 中没有任何模型,并且想了解更多关于 Sentence Transformers 的信息,请访问 www.SBERT.net!

你想将你的库集成到 Hub 吗?

这种集成得益于 huggingface_hub 库,它包含我们所有的小部件以及我们支持的所有库的 API。如果你想将你的库集成到 Hub,我们为你准备了一份指南!

参考文献

  1. Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. https://arxiv.org/abs/1908.10084

来源:Hugging Face:Blog(RSS) · huggingface.co