Token导航 LogoToken导航TokenDH.com
研究检索需要联网github未标认证来源可访问许可证需确认审计提醒

ollama-ragOllama RAG 搜索

Agent Skill

用于搭建或维护带检索增强的 RAG 工作流,适合让 Agent 处理知识库问答、向量检索、来源引用和事实核查。它可以辅助整理数据接入、Embedding、向量库、召回参数和回答生成流程。使用时需要确认数据来源、更新频率、召回阈值和引用展示方式,避免把未命中的资料或过期内容包装成确定事实。

总安装

408

周安装

17

GitHub Stars

公开资料未说明

下载量

136
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:ollama-rag(Ollama RAG 搜索)
来源仓库:https://github.com/cuba6112/skillfactory
仓库路径:skills/ollama-rag
安装命令:
npx skills add https://github.com/cuba6112/skillfactory --skill ollama-rag
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/cuba6112/skillfactory --skill ollama-rag

简介

ollama-rag 用于搭建或维护带检索增强的 RAG 工作流, 适合让 Agent 处理知识库问答、向量检索、来源引用和事实核查。

  • 它可以辅助整理数据接入、Embedding、向量库、召回参数和回答生成流程。
  • 使用时需要确认数据来源、更新频率、召回阈值和引用展示方式, 避免把未命中的资料或过期内容包装成确定事实。

SKILL.md

Ollama RAG Guide

Build RAG systems with Ollama - run locally or use cloud for massive models.

Ollama Cloud Models (Dec 2025)

Access via ollama signin (v0.12+). No local storage needed, privacy preserved.

ModelParamsContextBest For
deepseek-v3.2:cloud671B160KGPT-5 level, reasoning
deepseek-v3.1:671b-cloud671B160KThinking + non-thinking hybrid
qwen3-coder:480b-cloud480B256K-1MAgentic coding, repo-scale
minimax-m2:cloud230B (10B active)128K#1 open-source, tools
gpt-oss:120b-cloud120B128KOpenAI open weights
glm-4.6:cloud--Code generation
# Sign in to access cloud
ollama signin

# Run cloud models
ollama run deepseek-v3.2:cloud
ollama run qwen3-coder:480b-cloud
ollama run minimax-m2:cloud

Local Models (Dec 2025)

Reasoning Models

ModelParamsContextBest For
nemotron-3-nano30B (3.6B active)1M tokensAgents, long docs, code
deepseek-r17B-671B128KReasoning, math, code
qwq32B32KLogic, analysis
llama4109B/400B128KGeneral, multimodal

Fast/Efficient Models

ModelSizeRAMSpeed
llama3.2:3b2GB8GBVery fast
mistral-small-3.124B16GBFast
gemma34B-27B8-32GBBalanced

Embedding Models

ModelDimsContextMTEB Score
snowflake-arctic-embed210248K67.5
mxbai-embed-large102451264.68
nomic-embed-text7688K53.01

Recommendation: snowflake-arctic-embed2 for accuracy, nomic-embed-text for speed.

Quick Start

Cloud (No Local Resources)

ollama signin
ollama run deepseek-v3.2:cloud  # GPT-5 level
ollama run qwen3-coder:480b-cloud  # 1M context for huge repos

Local

ollama pull nemotron-3-nano  # 1M context, 24GB VRAM
ollama pull snowflake-arctic-embed2

# Or for lower RAM (8GB)
ollama pull llama3.2:3b
ollama pull nomic-embed-text

Stack Options

Option A: LangChain + ChromaDB (Most Common)

from langchain_ollama import OllamaLLM, OllamaEmbeddings
from langchain_chroma import Chroma
from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain_community.document_loaders import PyPDFLoader

# Load and split
loader = PyPDFLoader("document.pdf")
splitter = RecursiveCharacterTextSplitter(chunk_size=1000, chunk_overlap=200)
docs = splitter.split_documents(loader.load())

# Embed and store
embeddings = OllamaEmbeddings(model="snowflake-arctic-embed2")
vectorstore = Chroma.from_documents(docs, embeddings, persist_directory="./db")

# Query - LOCAL
llm = OllamaLLM(model="nemotron-3-nano")

# Or CLOUD (GPT-5 level, no local resources)
llm = OllamaLLM(model="deepseek-v3.2:cloud")

retriever = vectorstore.as_retriever(search_kwargs={"k": 5})

from langchain.chains import RetrievalQA
qa = RetrievalQA.from_chain_type(llm=llm, retriever=retriever)
answer = qa.invoke("What is the main topic?")

Option B: LlamaIndex (Better Accuracy)

from llama_index.llms.ollama import Ollama
from llama_index.embeddings.ollama import OllamaEmbedding
from llama_index.core import VectorStoreIndex, SimpleDirectoryReader, Settings

# Configure
Settings.llm = Ollama(model="nemotron-3-nano", request_timeout=300.0)
Settings.embed_model = OllamaEmbedding(model_name="snowflake-arctic-embed2")

# Load and index
documents = SimpleDirectoryReader("./docs").load_data()
index = VectorStoreIndex.from_documents(documents)

# Query
query_engine = index.as_query_engine()
response = query_engine.query("Summarize the key findings")

Option C: Direct Ollama API (Minimal Dependencies)

import ollama
import chromadb

# Embed
def embed(text):
    return ollama.embed(model="nomic-embed-text", input=text)["embeddings"][0]

# Store in ChromaDB
client = chromadb.PersistentClient(path="./db")
collection = client.get_or_create_collection("docs")
collection.add(ids=["1"], documents=["text"], embeddings=[embed("text")])

# Retrieve and generate
results = collection.query(query_embeddings=[embed("query")], n_results=3)
context = "\n".join(results["documents"][0])

response = ollama.chat(
    model="nemotron-3-nano",
    messages=[{"role": "user", "content": f"Context:\n{context}\n\nQuestion: ..."}]
)

Vector Database Options

DatabaseInstallBest For
ChromaDBpip install chromadbSimple, embedded
FAISSpip install faiss-cpuFast similarity
Qdrantpip install qdrant-clientProduction scale
WeaviateDockerFull-featured

Nemotron 3 Nano Deep Dive

Why Nemotron for RAG:

  • 1M token context = entire codebases, long documents
  • Hybrid Mamba-Transformer = 4x faster inference
  • MoE (3.6B active params) = runs on 24GB VRAM
  • Apache 2.0 license = commercial use OK
# For very long documents
llm = OllamaLLM(
    model="nemotron-3-nano",
    num_ctx=131072,  # 128K context, increase as needed
    temperature=0.1,  # Lower for factual RAG
)

Hardware Requirements

ModelRAMGPU VRAM
3B models8GB4GB
7-8B models16GB8GB
30B models32GB24GB
70B+ models64GB+48GB+

References

适合场景

01

研究助手

02

事实核查

03

知识库问答

04

带来源的搜索总结

能力概览

能力 1

组合搜索和大模型调用

能力 2

支持多来源检索和总结

能力 3

强调引用来源和事实核查

能力 4

适合研究型 Agent 流程

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

31.37%
按下载量换算43

Claude

31.69%
按下载量换算43

Cursor

18.73%
按下载量换算25

Gemini CLI

8.57%
按下载量换算12

安全审计

Gen Agent Trust Hub

可疑

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills