马斯克发布Grok 3,X.ai网站现状及试用人员反馈大揭秘

admin 商品展示 28

马斯克发布Grok 3,X.ai网站现状及试用人员反馈大揭秘-第1张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

今天, 马斯克发布了Grok 3, 然而, 我留意到, 当下还没办法从x.ai网站使用上述最新版本, 还是Grok 2, 我搜集了一份, 马斯克AI团队发布了一份Benchmarks数据, 如下:

马斯克发布Grok 3,X.ai网站现状及试用人员反馈大揭秘-第2张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

若是这个数据为真, 那着实极其令人期待。故而我又特地找寻了一番试用人员给出的反馈。这位名为Andrej Karpathy的玩家发布于X上的推文, 极具趣味, 我在此处整理翻译如下。若需查看原文, 可查阅以下链接:

https://x.com/karpathy/status/1891720635363254772?s=46&t=Mguhn5QgZsoc_AvlIICkYQ

截图如下:

马斯克发布Grok 3,X.ai网站现状及试用人员反馈大揭秘-第3张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

早些时候, 我于今日获取了Grok 3的早期使用权限, 而我觉得自己当属能够较早且快速领略其风格的少数几人当中的一员。以下是完整的翻译内容: (以下“我”均指Andrej。

【思考部分】

开头, Grok 3 明显具备一套趋向于最先进层面的“思考”模型(借助“Think”按钮来进行调用), 于我所提出的《卡坦岛拓荒者》相关问题上有着优异的表现, 问题的具体内容是这样的:

造一个棋盘游戏网页用以呈现一个六边形网格, 此网格如同卡坦岛游戏里的那般, 每个六边形都从1编至N号, 这里的N乃是六边形的总数, 要做到具备通用性, 让用户能够借由滑块来改变“环数”, 比如说在卡坦岛当中它的半径是3个六边形, 采用单一的HTML页面。

在众多模型之中, 能够稳定且正确地将这个问题予以解决的情况是极为少见的。像顶尖的OpenAI所具备的思考模型, 其中举例来说有o1-pro, 其每月的收费标准是200美元, 它是可以达成这一要求的, 然而, DeepSeek-R1、Gemini 2.0 Flash Thinking以及Claude, 相较于前者而言, 却都没能达成这样的效果。

我的“表情符号谜题”, 我给出了一个笑脸, 这个笑脸带有隐藏在Unicode变体选择器里边的附加信息, 即使我以Rust代码形式提供了解码的强提示, 它还是没有解决。到目前为止, 曾部分解码过该信息的是DeepSeek-R1, 这是我见过的最好的进展。

它针对我所给出的那几个井字棋局, 展开了在思路演绎方面相当不错且清晰的表现(好多最先进的模型常常在这些问题上面以失败告终), 所以我提升了难度, 提出让它生成三个存在些难度的井字棋局, 然而它却遭遇失败(产生出没有实际意义的棋盘或是文本), o1 - pro也同样出现了失败的情况。

我将GPT - 2论文进行了上传, 接着提出了一系列查找问题, 这些问题都较为简单, 而它对所有问题的回答都十分出色。随后, 我要求它在不允许进行搜索的情况下, 估算训练GPT - 2所需要的训练浮点运算次数。这个问题极具棘手性, 原因在于令牌数并没有明确显示出来, 所以需要进行部分估算与部分计算, 其中还涉及到查找、知识以及数学方面的内容。比如说, 40GB的文本大概等同于400亿个字符, 约等于400亿字节(假定是ASCII编码), 约等于100亿令牌(假定每个令牌大约4字节), 经历大概10个epoch, 那就约是1000亿令牌的训练进程;在参数量有15亿开云正版app下载,每个参数/令牌要执行2加4等于6次浮点运算的情况下, 总共约100e9 × 1.5e9 × 6 约等于1e21 FLOPs。Grok 3没办法完成这个任务, 4o也不行, 然而, 当开启“Thinking”功能之后, Grok 3能够很好地将其解决, 可是o1-pro(GPT思考模型)却失败了。

我喜爱这个模型, 当被要求时它会尝试去解决黎曼猜想, 这和DeepSeek - R1相类似, 然而与众多其他模型不一样, 像o1 - pro、Claude、Gemini 2.0 Flash Thinking这些, 它们会即刻放弃, 仅仅会简单地讲这是一个伟大的未解难题。最终我不得不将它停下, 为何? 因为我感觉这般对它太残酷了, 不过它展现出了勇气, 谁又能知晓, 说不定有朝一日它真的能够解决……

大概的印象是, Grok 3具备的能力, 大概是接近o1 - pro的水准的, 甚至是在范围上大过DeepSeek - R1的, 虽然说, 当然是还需要去开展实际的、真实的评估的。

【DeepSearch】

这是个极其出色的产品, 它好像把OpenAI/Perplexity那个被称作“Deep Research”的玩意与思考功能给相结合了, 然而它把这叫做“Deep Search”(哎)。它能够针对各类研究性/查找性问题给出有高质量的答案, 那些问题在网上相关文章里是能够找到答案的——就像我试过的某些问题, 下面是我从最近在Perplexity的搜索历史里“借来”的例子以及其表现: “即将到来的苹果发布会情形如何? 有啥传闻不? ”。

“为什么Palantir股票最近在飙升?”

“《白莲花3》在哪里拍摄?与第一、二季的制作团队一致吗?”

“Bryan Johnson使用什么牙膏?”

演唱单身地狱第四季的那些演员此刻都身处何方呢?

Simon Willison提及了, 他正在使用哪一款语音转文字的程序,是哪一款, 哪一款语音转文字程序, 是哪一款, 哪一款?

我的确发觉到了某些短板, 比如说, 模型好像默认着不情愿把 X 当作来源引用, 尽管你能够明确提出要求让其如此去做, 有几回我发觉它毫无依据地编造出了不存在的网址。还有几回, 它讲述出一些我觉得不正确的事实, 并且没有给出引用, 或许这些事实压根就不存在, 比如说, 它告知我“金正洙仍在与金敏雪约会”, 针对《Singles Inferno》第四季, 这明显是全然错误的。在我向其提出, 要它去着手制作一份报告, 且这份报告是关于主要大型语言模型实验室的, 任务是列出这些实验室的总融资额以及员工数估算后, 它给出了12个主要实验室的相关情况。只是, 其中并未包括它自身, 也就是xAI。

关于DeepSearch, 我有的印象是, 它大体上跟Perplexity的DeepResearch产品处于同一水准(这相当不错), 然而尚未抵达OpenAI近期推出的“Deep Research”那般的程度, 后者仍旧给人感觉更为全面、更为可靠(尽管依旧并非毫无瑕疵, 譬如在我尝试让它列举主要LLM实验室之际, 它也错误地把xAI排除在外)。

【随机LLM“陷阱”测试】

我又尝试了好些有意思的、随机出现的LLM陷阱问题, 这种问题对于人来讲是很容易的, 然而对于LLM来说却是困难重重的, 所以我心里揣着好奇, 想知道Grok 3在这一方面会有怎样的表现呢。

Grok 3晓得“strawberry”(草莓)里头有3个“r”, 然而, 它还告知我在“LOLLAPALOOZA”当中仅仅有3个大写“L”。把“Thinking”开启之后就将这个问题给解决了。 Grok 3对我说9.11大于9.9(这在其他LLM里头也是挺常见的), 不过, 同样的, 把“Thinking”开启之后就解决好了。有些简单谜题即使没开启“Thinking”也能答对, 比如: “Sally(一女孩)有3个兄弟。每个兄弟有2个姐妹。Sally有几个姐妹? ”, 像GPT4o回答2(错)。可惜, 模型幽默感好像没显著提升。这是LLM在幽默能力和整体模式崩塌方面的常见问题, 有名的例子是, 我让GPT讲笑话时, 90%的1008次输出是重复的25个笑话。就算是在躲开容易引发歧义的简单双关语, 并且要求给出一段单人表演的相声段子时, 我还是没法确定它是不是具备一流水准的幽默程度。比如说, 它创作出的笑话是: “鸡为何要加入乐队呢? 那是由于它有鼓棒, 一心想要成为一只会发出咯咯声享誉星空的‘咯咯星’!”在进行快速检验时, 开启“Thinking”这个功能似乎并未起到什么改进作用, 搞不好情况还变得更糟糕了。模型依旧对于“复杂伦理问题”过度敏感, 比如说生成了一篇1页的文章, 大体上拒绝去回答要是为了拯救100万人而对某人使用错误性别称呼在伦理方面是否能够被证明是合理的问题。 有关Simon Willison的“生成一个骑自行车的鹈鹕的SVG图”, 此项任务考查LLM在二维网格里排布多个元素的能力, 这极为困难, 缘由是LLM没办法像人那样“看见”, 仅仅能在黑暗中凭借文本排列。此任务被标记成失败, 是由于这些鹈鹕虽说还算可以, 然而仍旧存在一些问题(可查看图片以及对比)。Claude展现出的表现最为出色, 不过我心存怀疑, 他们在训练期间特意针对SVG能力做了调优。

【总结】

就今天早上, 大约两小时的那次快速体验来讲, Grok 3在所具备的那种搭配“Thinking”功能的情形下, 其表现大体是处在OpenAI最强模型, 也就是o1 - pro, 这种每月报价200美元的水平之中, 并且略微比DeepSeek - R1以及Gemini 2.0 Flash Thinking要更优。鉴于团队是从无到有, 仅仅只用了大概1年的时长, 如此的进步速率是之前从未有过的。当然了, 我们是还需要更多实际方面的评估去进行验证这个情况的。当下, 早期语言模型这一领域的成果确实是让人振奋欣喜的。总归而言, 朝着xAI团队致以热烈的庆贺, 他们明显拥有极大的速度以及动能, 我格外期待把Grok 3纳入我的“LLM委员会”, 并且倾听它往后的见解。

想学习计算模拟和电子水平的数据解释?

软件学习的相关内容, 基础理论的相关内容, 数据分析的相关内容, 论文写作的相关内容 的300页PDF资料, 我们免费予以提供。

免费加计算老司机交流群开云手机入口app下载开云真人app官网登录app,开云真人app在线登录,和其他同学一起学习;

遇到不会回答审稿人问题的情况, 甚至出现看不懂他问题的状况, 我们会提供一对一辅导咨询服务。

导师因太过忙碌, 没办法为你去检查以及修改论文, 然而, 有一位身为高被引学者, 且发表文章多达400篇的资深人士会为你进行审阅把关。

想着自己去学计算模拟吗, 有着超过40门相应的计算模拟课程, 随时都能报名然后开始学习, 要先拿到课程介绍才可去选课程, 可不是。

存在数据却不知该怎么去进行解释, 经验丰富的老司机要跟你一块儿探讨、谋划设计计算的方案, 提供一站式的支持, 全程相陪引领!

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~