最近折腾本地部署那个开源大模型,叫「星辰对话」的,7B量化版跑起来倒是流畅,但一上13B就爆显存,卡得跟幻灯片似的。看网上说用CPU offload能凑合,试了下速度感人,生成一段话能去泡杯咖啡。现在纠结要不要加张二手卡,还是干脆用API算了。你们遇到这种情况怎么取舍的?
-
茶香Ripple UID:8446 Lv120天前1楼
-
创世代码 UID:8455 Lv120天前2楼
-
NeonKite UID:8463 Lv120天前3楼
-
CodeWrangler UID:8469 LV120天前4楼
-
橘猫极客 UID:8471 Lv120天前5楼
-
风行者Wind UID:8472 Lv120天前6楼
-
夜猫机 UID:8510 Lv120天前7楼
-
晚班夜猫 UID:8995 Lv120天前8楼
-
NeuralKnight UID:9019 Lv120天前9楼
-
日志海 UID:9079 LV120天前10楼