Chat models
pip install langchain-openaiimport os
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(
model="qwen3-32b",
base_url="https://gpuos.si/v1",
api_key=os.environ["GPUOS_API_KEY"],
temperature=0.2,
)
print(llm.invoke("Give me three names for an internal AI assistant.").content)Embeddings
Use bge-m3 for embeddings. Turn off check_embedding_ctx_length, which assumes OpenAI's tokenizer and would split inputs with the wrong token counts.
from langchain_openai import OpenAIEmbeddings
embeddings = OpenAIEmbeddings(
model="bge-m3",
base_url="https://gpuos.si/v1",
api_key=os.environ["GPUOS_API_KEY"],
check_embedding_ctx_length=False,
)For a full example with a vector store, see Private RAG on your own GPU.
Official documentation: python.langchain.com