-
Notifications
You must be signed in to change notification settings - Fork 26
Expand file tree
/
Copy pathmain.py
More file actions
55 lines (49 loc) · 2.21 KB
/
Copy pathmain.py
File metadata and controls
55 lines (49 loc) · 2.21 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
from transformers import AutoModelForCausalLM, AutoTokenizer
import argparse
import os
import time
import pickle
import torch
from lmcache.config import LMCacheEngineConfig, LMCacheEngineMetadata
from lmcache.storage_backend.serde.cachegen_encoder import CacheGenSerializer
import json
from src.utils import *
p = argparse.ArgumentParser()
p.add_argument("--model_id", type = str, default = "lmsys/longchat-7b-16k")
p.add_argument("--save_dir", type=str, default = None)
p.add_argument("--num_gpus", type=int, default = 1)
p.add_argument("--max_gpu_memory", type=int, default=48, help="Default max GPU memory in GiB on A40")
p.add_argument("--path_to_context", type=str, help="The directory where the contexts are stored. ")
p.add_argument("--start", type=int, default = 0)
p.add_argument("--end", type=int, default = 1)
p.add_argument("--dataset_name", type=str)
args = p.parse_args()
if __name__ == "__main__":
# Check if save_dir exists
if not os.path.exists(args.save_dir):
os.makedirs(args.save_dir, exist_ok=True)
model, tokenizer = define_model_and_tokenizer(args.model_id, num_gpus=args.num_gpus, max_gpu_memory=args.max_gpu_memory)
print("Model and tokenizer loaded")
data = load_testcases(DATASET_TO_PATH[args.dataset_name])
for doc_id in range(args.start, args.end):
print("Saving KV cache for doc: ", doc_id)
text = data[doc_id]['prompt']
input_ids = tokenizer(text, return_tensors="pt").input_ids.cuda()
# print("Length of input: ", input_ids.shape)
st = time.monotonic()
generated = model.generate(input_ids, max_new_tokens = 1, return_dict_in_generate=True)
torch.cuda.synchronize()
# print( f"TTFT: {time.monotonic() - st}" )
kv = generated['past_key_values']
kv = list(kv)
key_value = []
for i in range(len(kv)):
kv[i] = list(kv[i])
kv[i][0] = kv[i][0][:, :, :-1][0]
kv[i][1] = kv[i][1][:, :, :-1][0]
kv[i] = tuple(kv[i])
kv = tuple(kv)
kv_tensor = to_blob(kv)
torch.save(kv_tensor, f"{args.save_dir}/raw_kv_{doc_id}.pt")
if doc_id == 0:
pickle.dump(kv, open(f"{args.save_dir}/raw_kv_{doc_id}.pkl", "wb"))