Skip to content

Class: LlamaModel

Defined in: evaluator/LlamaModel/LlamaModel.ts:224

Properties

tokenizer

ts
readonly tokenizer: Tokenizer;

Defined in: evaluator/LlamaModel/LlamaModel.ts:254


onDispose

ts
readonly onDispose: EventRelay<void>;

Defined in: evaluator/LlamaModel/LlamaModel.ts:255

Accessors

disposed

Get Signature

ts
get disposed(): boolean;

Defined in: evaluator/LlamaModel/LlamaModel.ts:385

Returns

boolean


llama

Get Signature

ts
get llama(): Llama;

Defined in: evaluator/LlamaModel/LlamaModel.ts:389

Returns

Llama


tokens

Get Signature

ts
get tokens(): LlamaModelTokens;

Defined in: evaluator/LlamaModel/LlamaModel.ts:393

Returns

LlamaModelTokens


filename

Get Signature

ts
get filename(): string | undefined;

Defined in: evaluator/LlamaModel/LlamaModel.ts:397

Returns

string | undefined


fileInfo

Get Signature

ts
get fileInfo(): GgufFileInfo;

Defined in: evaluator/LlamaModel/LlamaModel.ts:401

Returns

GgufFileInfo


fileInsights

Get Signature

ts
get fileInsights(): GgufInsights;

Defined in: evaluator/LlamaModel/LlamaModel.ts:405

Returns

GgufInsights


architecture

Get Signature

ts
get architecture(): GgufArchitectureType;

Defined in: evaluator/LlamaModel/LlamaModel.ts:409

Returns

GgufArchitectureType


gpuLayers

Get Signature

ts
get gpuLayers(): number;

Defined in: evaluator/LlamaModel/LlamaModel.ts:417

Number of layers offloaded to the GPU. If GPU support is disabled, this will always be 0.

Returns

number


useMmap

Get Signature

ts
get useMmap(): boolean;

Defined in: evaluator/LlamaModel/LlamaModel.ts:427

Whether the model is loaded using mmap (memory-mapped file) or not.

When Direct I/O (setting the useDirectIo option to true) is used it'll override mmap and this value may be out of sync with the actual usage of mmap for the loading of this model instance.

Returns

boolean


lazyMode

Get Signature

ts
get lazyMode(): boolean | "auto";

Defined in: evaluator/LlamaModel/LlamaModel.ts:431

Returns

boolean | "auto"


size

Get Signature

ts
get size(): number;

Defined in: evaluator/LlamaModel/LlamaModel.ts:440

Total model size in memory in bytes.

When using mmap, actual memory usage may be higher than this value due to llama.cpp's performance optimizations.

Returns

number


flashAttentionSupported

Get Signature

ts
get flashAttentionSupported(): boolean;

Defined in: evaluator/LlamaModel/LlamaModel.ts:446

Returns

boolean


defaultContextFlashAttention

Get Signature

ts
get defaultContextFlashAttention(): boolean | "auto";

Defined in: evaluator/LlamaModel/LlamaModel.ts:450

Returns

boolean | "auto"


defaultContextSwaFullCache

Get Signature

ts
get defaultContextSwaFullCache(): boolean;

Defined in: evaluator/LlamaModel/LlamaModel.ts:454

Returns

boolean


defaultContextKvCacheKeyType

Get Signature

ts
get defaultContextKvCacheKeyType(): GgmlType;

Defined in: evaluator/LlamaModel/LlamaModel.ts:458

Returns

GgmlType


defaultContextKvCacheValueType

Get Signature

ts
get defaultContextKvCacheValueType(): GgmlType;

Defined in: evaluator/LlamaModel/LlamaModel.ts:462

Returns

GgmlType


memoryUsage

Get Signature

ts
get memoryUsage(): {
  ram: number;
  vram: number;
};

Defined in: evaluator/LlamaModel/LlamaModel.ts:467

Assumed memory footprint of the model in bytes

Returns
ts
{
  ram: number;
  vram: number;
}
ram
ts
ram: number;
vram
ts
vram: number;

trainContextSize

Get Signature

ts
get trainContextSize(): number;

Defined in: evaluator/LlamaModel/LlamaModel.ts:762

The context size the model was trained on

Returns

number


embeddingVectorSize

Get Signature

ts
get embeddingVectorSize(): number;

Defined in: evaluator/LlamaModel/LlamaModel.ts:772

The size of an embedding vector the model can produce

Returns

number


vocabularyType

Get Signature

ts
get vocabularyType(): LlamaVocabularyType;

Defined in: evaluator/LlamaModel/LlamaModel.ts:781

Returns

LlamaVocabularyType

Methods

dispose()

ts
dispose(): Promise<void>;

Defined in: evaluator/LlamaModel/LlamaModel.ts:371

Returns

Promise<void>


tokenize()

Call Signature

ts
tokenize(
   text: string, 
   specialTokens?: boolean, 
   options?: "trimLeadingSpace"): Token[];

Defined in: evaluator/LlamaModel/LlamaModel.ts:487

Transform text into tokens that can be fed to the model

Parameters
ParameterTypeDescription
textstringthe text to tokenize
specialTokens?booleanif set to true, text that correspond to special tokens will be tokenized to those tokens. For example, <s> will be tokenized to the BOS token if specialTokens is set to true, otherwise it will be tokenized to tokens that corresponds to the plaintext <s> string.
options?"trimLeadingSpace"additional options for tokenization. If set to "trimLeadingSpace", a leading space will be trimmed from the tokenized output if the output has an additional space at the beginning.
Returns

Token[]

Call Signature

ts
tokenize(text: BuiltinSpecialTokenValue, specialTokens: "builtin"): Token[];

Defined in: evaluator/LlamaModel/LlamaModel.ts:488

Transform text into tokens that can be fed to the model

Parameters
ParameterTypeDescription
textBuiltinSpecialTokenValuethe text to tokenize
specialTokens"builtin"if set to true, text that correspond to special tokens will be tokenized to those tokens. For example, <s> will be tokenized to the BOS token if specialTokens is set to true, otherwise it will be tokenized to tokens that corresponds to the plaintext <s> string.
Returns

Token[]


detokenize()

ts
detokenize(
   tokens: readonly Token[], 
   specialTokens?: boolean, 
   lastTokens?: readonly Token[]): string;

Defined in: evaluator/LlamaModel/LlamaModel.ts:602

Transform tokens into text

Parameters

ParameterTypeDefault valueDescription
tokensreadonly Token[]undefinedthe tokens to detokenize.
specialTokens?booleanfalseif set to true, special tokens will be detokenized to their corresponding token text representation. Recommended for debugging purposes only. > Note: there may be additional spaces around special tokens that were not present in the original text - this is not a bug, this is how the tokenizer is supposed to work. Defaults to false.
lastTokens?readonly Token[]undefinedthe last few tokens that preceded the tokens to detokenize. If provided, the last few tokens will be used to determine whether a space has to be added before the current tokens or not, and apply other detokenizer-specific heuristics to provide the correct text continuation to the existing tokens. Using it may have no effect with some models, but it is still recommended.

Returns

string


getTokenAttributes()

ts
getTokenAttributes(token: Token): TokenAttributes;

Defined in: evaluator/LlamaModel/LlamaModel.ts:623

Parameters

ParameterType
tokenToken

Returns

TokenAttributes


isSpecialToken()

ts
isSpecialToken(token: Token | undefined): boolean;

Defined in: evaluator/LlamaModel/LlamaModel.ts:634

Check whether the given token is a special token (a control-type token or a token with no normal text representation)

Parameters

ParameterType
tokenToken | undefined

Returns

boolean


iterateAllTokens()

ts
iterateAllTokens(): Generator<Token, void, unknown>;

Defined in: evaluator/LlamaModel/LlamaModel.ts:649

Returns

Generator<Token, void, unknown>


isEogToken()

ts
isEogToken(token: Token | undefined): boolean;

Defined in: evaluator/LlamaModel/LlamaModel.ts:662

Check whether the given token is an EOG (End Of Generation) token, like EOS or EOT.

Parameters

ParameterType
tokenToken | undefined

Returns

boolean


createContext()

ts
createContext(options?: LlamaContextOptions): Promise<LlamaContext>;

Defined in: evaluator/LlamaModel/LlamaModel.ts:669

Parameters

ParameterType
optionsLlamaContextOptions

Returns

Promise<LlamaContext>


createEmbeddingContext()

ts
createEmbeddingContext(options?: LlamaEmbeddingContextOptions): Promise<LlamaEmbeddingContext>;

Defined in: evaluator/LlamaModel/LlamaModel.ts:686

Parameters

ParameterType
optionsLlamaEmbeddingContextOptions

Returns

Promise<LlamaEmbeddingContext>

See

Using Embedding tutorial


createRankingContext()

ts
createRankingContext(options?: LlamaRankingContextOptions): Promise<LlamaRankingContext>;

Defined in: evaluator/LlamaModel/LlamaModel.ts:696

Parameters

ParameterType
optionsLlamaRankingContextOptions

Returns

Promise<LlamaRankingContext>

See

Reranking Documents tutorial


getWarnings()

ts
getWarnings(): string[];

Defined in: evaluator/LlamaModel/LlamaModel.ts:708

Get warnings about the model file that would affect its usage.

These warnings include all the warnings generated by GgufInsights, but are more comprehensive.

Returns

string[]