[NS : wzxsoft] 8GB 显存跑中文本地模型,量化和上下文怎么取舍?

如果目标是中文对话和简单代码辅助,大家会优先挑小参数模型还是更激进的量化?实际使用中,显存占用、上下文长度和首token延迟哪个最先成为瓶颈?欢迎分享具体模型与配置。
 
 
Back to Top