Ollama
一个开源工具,专注于简化大型语言模型(LLMs)的本地部署和管理
2025年7月昆仑万维团队发布的Skywork-Reward-V2,是第二代开源奖励模型(Reward Model)系列,覆盖8款不同参数规模的模型——参数量从6亿到80亿不等,训练基础为Qwen3、LLaMA3等业内主流预训练模型。该系列模型在RewardBench v1/v2、PPE、RM-Bench、JudgeBench等七大主流奖励模型评测基准中实现全面领先,在人类偏好对齐、客观正确性、安全性三大核心维度均表现突出。