Just appreciation, nothing to see here

#13
by dandandelion - opened

Your quantization techniques are really unparalleled. IQ3_XXS and still kicking. Looking forward for the 3.5 bpw one and possibly maybe even a 4-bit? (cause 4-bit runs slightly better than 3bit on most GPUs).

Also do you have plans on attaching mtp draft onto the model themselves?

GSQ-RCO 若出 Q4 档,理论下界是同体积不输 UD-Q4_K_XL;但它的方法学价值全部兑现在低比特段,而它已经兑现的那部分(3bpw 档 99.4%)恰好就是 64GB GPU的正解——所以值得盯的是"有人同卷验证它的 IQ3_XXS 档",而不是"它什么时候出 Q4"。

话说 ~3bpw 那档分数其实还没到顶吧,往 IQ3_S(~3.5bpw?)走应该还能再捞一点?

话说 ~3bpw 那档分数其实还没到顶吧,往 IQ3_S(~3.5bpw?)走应该还能再捞一点?

原来大家都是同文同语境的,那就简单多了,这个千问的新架构我测试过好几档权重了,其实只要别到IQ2,性能都大差不差,不必纠结。目前llama.cpp还不成熟,所以这个模型的性能连官方都在忍受,千问AI官方的API也才65 t/s左右,只要不能全GPU就得看CPU和内存的带宽。我是EPYC 7B12 +256GB DDR4(8通道),所以单卡5060Ti 16GB走CPU卸载路线,在MTP加持下,日常在35 t/s的水平,峰值到47 t/s最高,所以这个模型最折磨人的是吐字速度,质量反而次之。Q4_0压缩KV的话,勉强到256K上下文,带多模态,加载进DSH里能磨磨蹭蹭的干活,着急的事用不了它,还得是DS的API好使。最近研究发现,跑这个最好的选择是170HX解锁到64GB的矿渣,可惜出手晚了,早早知道解锁的消息,还在git上参与写了点,结果现在价格离谱,只能作罢!新架构,体验和积累比实际使用重要一些吧,据说年底前发布qwen4架构正式版,希望到时出的模型能对边缘化的端侧部署友好些吧!现在看4090 48GB是真香,可惜还是没在涨价前上车!

IST Austria Distributed Algorithms and Systems Lab org

Your quantization techniques are really unparalleled. IQ3_XXS and still kicking. Looking forward for the 3.5 bpw one and possibly maybe even a 4-bit? (cause 4-bit runs slightly better than 3bit on most GPUs).

Thank you so much for the kind words and for your interest in our models! We’re planning to release a 3.5-bit version in the coming days along with a pruned variant specifically optimized for coding and agentic use.

Also do you have plans on attaching mtp draft onto the model themselves?

Yes we do! We definitely plan to support that. We have quite a few things on our roadmap at the moment, though, so I can’t give you an exact timeline just yet.

原来大家都是同文同语境的,那就简单多了,这个千问的新架构我测试过好几档权重了,其实只要别到IQ2,性能都大差不差,不必纠结。目前llama.cpp还不成熟,所以这个模型的性能连官方都在忍受,千问AI官方的API也才65 t/s左右,只要不能全GPU就得看CPU和内存的带宽。我是EPYC 7B12 +256GB DDR4(8通道),所以单卡5060Ti 16GB走CPU卸载路线,在MTP加持下,日常在35 t/s的水平,峰值到47 t/s最高,所以这个模型最折磨人的是吐字速度,质量反而次之。Q4_0压缩KV的话,勉强到256K上下文,带多模态,加载进DSH里能磨磨蹭蹭的干活,着急的事用不了它,还得是DS的API好使。最近研究发现,跑这个最好的选择是170HX解锁到64GB的矿渣,可惜出手晚了,早早知道解锁的消息,还在git上参与写了点,结果现在价格离谱,只能作罢!新架构,体验和积累比实际使用重要一些吧,据说年底前发布qwen4架构正式版,希望到时出的模型能对边缘化的端侧部署友好些吧!现在看4090 48GB是真香,可惜还是没在涨价前上车!

q4 kv会导致token效率严重降低,表现在思维冗长反复自我怀疑和产物错误率提高反复自我纠错上,q4kv换取的长上下文往往不如q8kv让他快速完工

Sign up or log in to comment