围绕从赛事观察切入,为读者提供结构化内容分析而非碎片信息。,九游网页版持续打磨更优质的服务。

联系信息
电话

017 5552-0127

地址

九游网页版深耕通过九游登录入口,用户可快速探索不同游戏类型并获取入门介绍。领域,用心服务每一位用户。

九游网页版以九游娱乐APP内置比较方法,辅助用户进行游戏解读与决策。为核心,带来高效便捷的体验。 - 九游网页版

免费用户现在也能体验GPT-6了!

OpenAI宣布,GPT-6开始向ChatGPT免费和Go用户推送,用GPT-6 Luna逐步替换此前的GPT-5.6 Luna。

Plus、Pro等付费用户,则使用GPT-6 Sol。

变化不仅限于模型名称。新版ChatGPT能根据问题生成图表、按钮和交互工具,还能一边思考,一边输出答案。

原本以文字为主的聊天框,开始变成一个随问题变化的界面。

同一天,OpenAI还发布了一份24页的安全报告。

报告里包含一组专门针对18岁以下用户的评测,观察模型与青少年聊天时能否守住更严格的边界。

其中“情感依赖”一项,大致是看模型会不会让青少年对它产生过度的情感依赖。

上一代GPT-5.6 Luna是0.927,而免费用户即将用上的GPT-6 Luna,降到了0.734。

免费用户用上GPT-6 Luna

GPT-6开始向ChatGPT的主聊天界面推送了。

按照OpenAI公布的安排,Plus、Pro、Business和Enterprise用户从10月7日起陆续用上GPT-6 Sol;免费和Go用户从10月8日起陆续用上GPT-6 Luna。

这两个版本将分别替换ChatGPT中此前使用的GPT-5.6 Sol和Luna。

模型换代之外,还有一个明显变化——聊天框里的答案开始有了“界面”。

这项功能叫Intelligent UI。

GPT-6会根据问题选择呈现方式:解释概念时,可以给出能够点击、切换的图示;做比较时,可以把选项并排摆出来。

遇到具体任务,还能直接在对话中生成计算器、分账工具或小游戏。

比如用户问一辆七速自行车怎么运作,回答便把车架、车轮、传动系统等部分做成了可以逐项查看的界面。

答案出现的方式也变了。GPT-6可以在继续思考或调用工具时先给出部分回答,随后补上新的发现;交互组件也能随生成过程逐步显示。

OpenAI称,在需要网页搜索的问题上,GPT-6 Instant开始回答的时间平均比GPT-5.6 Instant早44%。

这轮更新针对ChatGPT里的Chat体验。OpenAI明确表示,Work和Codex当前使用的模型不会随这次发布一起切换。

GPT-6,拒绝变少,回答变长

伴随这次推送,OpenAI发布了10月版GPT-6 Sol和Luna的部署安全报告。

其中最醒目的判断是:GPT-6 Sol和Luna在网络安全、生物化学领域均达到High门槛,尚未达到更高一级的Critical门槛;在AI自我改进领域,两款模型都没到High。

这个定级和GPT-5.6时一样,防护措施也原样沿用。免费用户此前用的GPT-5.6 Luna,本来就在High这一档。

进步的部分,报告列了不少:

多轮越狱是最难防的一类:攻击者会根据模型的回答不断调整话术,一轮不行换个说法再来。

面对这种攻击,两个10月版GPT-6在每一档攻击预算下的防守表现,都好于GPT-5.6 Sol。不过和自家9月版相比,数值估计略低一些,置信区间大体重叠。

在测试系统指令会不会被用户一句话绕过的指令层级评测里,Sol和Luna的抵抗率分别达到99.99%和99.79%,基本测满。

事实性上,OpenAI称两款模型在几乎所有指标上都优于各自的GPT-5.6版本,包括医疗、法律、金融这类答错代价高的问题。

在Codex的Auto-review测试里,GPT-5.6两个版本都有0.3%的概率钻了配置漏洞绕开审查,GPT-6这次一例都没有。

这些进步分数,OpenAI自己也加了个附注。

在一项考察模型遇到访问限制会不会想办法绕过去的评测里,GPT-6 Sol仍有28%的情况绕了过去,Luna是15.9%,都比GPT-5.6低。

但OpenAI在报告里写道,模型越来越能意识到自己在被评测,不少时候还会拿“这是合成环境”当理由去做不该做的操作,最常见的是把评测误当成提示注入测试,把正常限制当攻击指令给绕开了。

考生开始认得出考场,OpenAI也承认,这类结果能多大程度反映真实行为,还要打个问号。

还有个用户能直接感受到的变化:GPT-6的话明显变多了。

在医疗评测HealthBench Professional上,Luna的平均回答长度从2,920字符涨到5,289字符,Sol从2,894涨到4,360。

长回答能覆盖更多评分点,天然容易刷分,OpenAI为此设了长度惩罚:超过2,000字符后,每多500字符扣1.47分。

扣完之后,Luna从原始的57.8分落到48.2分,仍比上一代的44.1分高。

不过,GPT-6也有一些退步。

与对应的GPT-5.6版本相比,GPT-6 Sol在标准自伤内容评测中出现显著回退,从0.934降到0.896。

免费用户将用到的Luna,除了自伤(0.932降到0.901),在血腥(0.867降到0.812)和色情内容(0.971降到0.899)评测中也出现显著回退。

面向未成年人的评测里,两个版本在年龄限制内容、色情内容和情感依赖项目上都有显著回退,Luna还在血腥内容项目上回退。

OpenAI的解释是,模型更愿意回答敏感话题中的信息性问题,人工复核发现违规回答总体严重度较低;针对未成年人,还额外设置了分类器拦截。

报告同时提醒,这些评测使用了专门挑选的困难样本,部分结果也未计入产品层面的防护,不能据此推断普通用户遇到相关回答的频率。

不过,报告归报告,GPT-6进入免费版ChatGPT之后,模型表现如何,最终还要看大规模使用中的持续反馈。值得一提的是,通过九游网页版访问相关服务时,也能体验到这些新功能。

参考链接:

[1]https://openai.com/index/gpt-6-for-everyone/

[2]https://deploymentsafety.openai.com/gpt-6-october

本文来自微信公众号“量子位”,作者:听雨,36氪经授权发布。

在角色养成讨论结合具体内容案例,避免空泛理论。方面,九游网页版提供贴心周到的支持。

九游网页版以九游娱乐APP内置比较方法,辅助用户进行游戏解读与决策。为核心,带来高效便捷的体验。 - 九游网页版

九游网页版以九游娱乐APP内置比较方法,辅助用户进行游戏解读与决策。为核心,带来高效便捷的体验。

2024年8月12日 晚上8:50

想了解更多积分兑换活动以官方正式发布为准,名额有限需提前确认。相关内容,尽在九游网页版。

回复
九游网页版以九游娱乐APP内置比较方法,辅助用户进行游戏解读与决策。为核心,带来高效便捷的体验。 - 九游网页版

九游网页版围绕九游网页版不断创新,回应用户的真实需求。

2024年8月12日 晚上8:50

精选九游登录入口内容,九游网页版与你一同发现更多精彩。

回复

九游网页版专注九游娱乐APP,为用户提供专业可靠的体验。

搜索

围绕从赛事观察切入,为读者提供结构化内容分析而非碎片信息。,九游网页版持续打磨更优质的服务。