Token导航 LogoToken导航TokenDH.com
研究检索需要联网github未标认证来源可访问clear审计异常

embeddingsembeddings 搜索

Agent Skill

用于搭建或维护带检索增强的 RAG 工作流,适合让 Agent 处理知识库问答、向量检索、来源引用和事实核查。它可以辅助整理数据接入、Embedding、向量库、召回参数和回答生成流程。使用时需要确认数据来源、更新频率、召回阈值和引用展示方式,避免把未命中的资料或过期内容包装成确定事实。

总安装

272

周安装

11

GitHub Stars

160

下载量

85
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

3

许可证

MIT

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:embeddings(embeddings 搜索)
来源仓库:https://github.com/yonatangross/orchestkit
仓库路径:skills/embeddings
安装命令:
npx skills add https://github.com/yonatangross/orchestkit --skill embeddings
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。不同来源提供的安装方式可能略有差异;本站展示可直接复制的安装命令,安装前请核对来源页面。

skills.shnpx skills
npx skills add https://github.com/yonatangross/orchestkit --skill embeddings

简介

用于将文本转换为密集向量表示,支持语义搜索和相似性匹配任务。

  • 适合使用 OpenAI 嵌入 API 进行单条或多条文本向量化,获取标准维度输出。
  • 提供模型选择参考,包括维度、成本和适用场景,便于根据需求选用合适模型。
  • 需配置 OpenAI 客户端并传入有效 API 密钥,确保请求合规且数据安全。
  • embeddings 属于研究检索类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

Embeddings

Convert text to dense vector representations for semantic search and similarity.

Quick Reference

from openai import OpenAI

client = OpenAI()

# Single text embedding
response = client.embeddings.create(
    model="text-embedding-3-small",
    input="Your text here"
)
vector = response.data[0].embedding  # 1536 dimensions
# Batch embedding (efficient)
texts = ["text1", "text2", "text3"]
response = client.embeddings.create(
    model="text-embedding-3-small",
    input=texts
)
vectors = [item.embedding for item in response.data]

Model Selection

ModelDimsCostUse Case
text-embedding-3-small1536$0.02/1MGeneral purpose
text-embedding-3-large3072$0.13/1MHigh accuracy
nomic-embed-text (Ollama)768FreeLocal/CI

Chunking Strategy

def chunk_text(text: str, chunk_size: int = 512, overlap: int = 50) -> list[str]:
    """Split text into overlapping chunks for embedding."""
    words = text.split()
    chunks = []

    for i in range(0, len(words), chunk_size - overlap):
        chunk = " ".join(words[i:i + chunk_size])
        if chunk:
            chunks.append(chunk)

    return chunks

Guidelines:

  • Chunk size: 256-1024 tokens (512 typical)
  • Overlap: 10-20% for context continuity
  • Include metadata (title, source) with chunks

Similarity Calculation

import numpy as np

def cosine_similarity(a: list[float], b: list[float]) -> float:
    """Calculate cosine similarity between two vectors."""
    a, b = np.array(a), np.array(b)
    return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))

# Usage
similarity = cosine_similarity(vector1, vector2)
# 1.0 = identical, 0.0 = orthogonal, -1.0 = opposite

Key Decisions

  • Dimension reduction: Can truncate text-embedding-3-large to 1536 dims
  • Normalization: Most models return normalized vectors
  • Batch size: 100-500 texts per API call for efficiency

Common Mistakes

  • Embedding queries differently than documents
  • Not chunking long documents (context gets lost)
  • Using wrong similarity metric (cosine vs euclidean)
  • Re-embedding unchanged content (cache embeddings)

Advanced Patterns

See references/advanced-patterns.md for:

  • Late Chunking: Embed full document, extract chunk vectors from contextualized tokens
  • Batch API: Production batching with rate limiting and retry
  • Embedding Cache: Redis-based caching to avoid re-embedding
  • Matryoshka Embeddings: Dimension reduction with text-embedding-3

Related Skills

  • rag-retrieval - Using embeddings for RAG pipelines
  • hyde-retrieval - Hypothetical document embeddings for vocabulary mismatch
  • contextual-retrieval - Anthropic's context-prepending technique
  • reranking-patterns - Cross-encoder reranking for precision
  • ollama-local - Local embeddings with nomic-embed-text

Capability Details

text-to-vector

Keywords: embedding, text to vector, vectorize, embed text Solves:

  • Convert text to vector embeddings
  • Choose appropriate embedding models
  • Handle embedding API integration

semantic-search

Keywords: semantic search, vector search, similarity search, find similar Solves:

  • Implement semantic search over documents
  • Configure similarity thresholds
  • Rank results by relevance

chunking-strategies

Keywords: chunk, chunking, split, text splitting, overlap Solves:

  • Split documents into optimal chunks
  • Configure chunk size and overlap
  • Preserve semantic boundaries

batch-embedding

Keywords: batch, bulk embed, parallel embedding, batch processing Solves:

  • Embed large document collections efficiently
  • Handle rate limits and retries
  • Optimize embedding costs

local-embeddings

Keywords: local, ollama, self-hosted, on-premise, offline Solves:

  • Run embeddings locally with Ollama
  • Deploy self-hosted embedding models
  • Reduce API costs with local models

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

04

需要参考平台分布和安装热度时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Claude Code

25.97%
按下载量换算22

windsurf

24.35%
按下载量换算21

trae

18.08%
按下载量换算15

OpenCode

13.31%
按下载量换算11

Codex

7.71%
按下载量换算7

Antigravity

3.94%
按下载量换算3

安全审计

Gen Agent Trust Hub

未通过

Socket

通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。

来源信息

继续浏览同类 Skills