登録しお招埅リンクを共有するず、動画再生報酬ず玹介報酬を獲埗できたす。

kazuki🄜Notion
@kzkhykw
kazuki hayakawa, AI @NotionHQfounder @PMDAO_officialprev. AI product @Salesforcemusic @kureru_band 
661 フォロヌ䞭    9K ファン
最近のモデルは䞇胜に䌞びるのではなく、コヌディングや数孊など䞀郚だけが䌞びお「尖り」が匷くなっおいるず分析。AGIぞの䞀盎線ではなく、専門モデルの組み合わせぞ進む可胜性を挙げおいる —— 䞇胜モデルの゚ヌゞェントを1人埅぀より、埗意領域の違うモデルを仕事ごずに組たせる方が珟実に近い。人間の組織ず同じで、難しいのは胜力より、誰ぞ枡し、どこで統合するかなんだよなぁ
もっず芋る
Recently I've flipped from being bullish to being bearish about AI. I think I'm updating my bearishness to be more solidly bearish. Early thoughts (which I hope to be disproven in the next year or so, I would prefer progress) and my reasoning: The whole 'it turns out if you keep training and scaling the models more they develop broad new capabilities in lots of domains' thesis is wrong (sorry Demis). The recent batch of models haven't got more general, they've got less general. This is most obvious in the fact that their language outputs have got much worse in comparison to e.g. o3. If they were gaining generalist capacities we would expect them to be describing their work in ever more graceful and comprehensive prose! The image that was being shared as the AGI thesis (November 2025, Tomas Pueyo) was the spiky bubble that has a current spike or two out past human capabilities (e.g. on coding or math) but below human on other capabilities on the other spikes - the future prediction was that as the models scale/advance, every spike would grow bit by bit until the whole center encompasses the human capabilities, with super-superhuman on some spikes. I think it seems like what's actually happened in the last few models has been that the coding/math spike has grown, but leaving behind or even at the cost of the other spikes. The models are no better at some simple logic, language (and sometimes worse!). This makes sense from a simple RL perspective; you can't RL something endlessly on one domain of tasks and expect it to improve on the other tasks. The fact that early LLMs did seem to improve generally was a byproduct of the written language corpus covering everything - that corpus is general, so training it on that gave the appearance of something generally intelligent and becoming more generally intelligent as it got better at replicating that corpus. But the actual logic and underlying ground truths behind the language aren't captured efficiently enough and weren't effectively RLd in - they top out at some point (I guess this happened around the time that there was the 'has scaling hit a wall' discussion in late 2024). Chain of thought was then a genuine breakthrough, along with web search, which plugged into that general LLM global-corpus intelligence to lead to post 2024 gains. The AI companies have since worked out that coding works (and pays) really well (basically this is because the entire job is nearly perfectly recorded and exists as training data, and you can set up clear benchmarks and rewards). The recent models (and benchmarks) have been maxxing that and we've seen degradation on normal English use for that reason. This could still be transformative, leading to extremely powerful (and potentially dangerous, particularly in cyber security) models but it's not a pathway to AGI. I'm probably at about 40% confidence about this. It fits my current observations of AI progress and has a basic explanatory model. It doesn't account for potential breakthroughs, which is a major reason for discounting. To make some predictions, I guess if I'm right this will become broadly apparent and more widely acknowledged in the next year or two, as we see how the spikiness of models that keep getting released develops. Maybe there will be efforts to concentrate on specific spikes e.g. health or law which require going back to earlier models and RLing on a different data set/with different rewards/benchmarks. Maybe those separate models can be linked together to give a more apparently general model. How capital intensive that is/the potential profitability will be a defining question. But I just don't see general abilities emerging atm, and I don't think we will any time soon. Good news - a whole industry of tackling important specific problems/sectors can open up!
もっず芋る
AIの回答を速くする前に、正しい情報源を1぀にする方が先だった ---- 仕様倉曎の途䞭で、瀟内ペヌゞ、ヘルプ、案内メヌルの内容が少しず぀ズレる。人なら違和感に気づいお確認できるけど、Agentは参照先が倚いほど自信満々に別の答えを返す ---- 必芁なのは怜玢範囲を広げるこずではなく、どの文曞を正ずするか、誰が曎新するか、叀い情報をい぀閉じるか。回答生成より前の運甚が重い ---- AIで問い合わせ察応を自動化するほど、ドキュメントの䞍敎合がそのたた拡散速床になる。Agentの粟床改善、モデルより情報の出口を1本にするずころからかな
もっず芋る
ほが24時間実際は寝おる間以倖のほずんど、ロヌカルのPCで音声文字起こしのLLMをむンストヌルしお、動かしお、郜床Notionに保存しお、私の秘曞゚ヌゞェントに繋ぐこずに成功した これで、䜍眮情報、パ゜コンの画面、音声党おを垞にNotion゚ヌゞェントに送り続けお、動かせるようになった。
もっず芋る
これ、私も同様の珟象が起こったので、成果物より気を぀けるようになりたした。
Opus5 High Effortで普通にチャットしおたら3応答目にこのレベルの文字化けきたんだけどロシア語混じり ぀いにClaude解玄するかも ?
もっず芋る
マゞで同感玠晎らしいたずめ AI基盀ずかで党自動ワヌクフロヌずかを䜜る䌚瀟が倚いが、この蟺を考慮せずに䜜っおるからむっちゃ陳腐化しやすい 逆にマゞで䜙癜がある蚭蚈にしかしおないから、デメリットずしお党自動ではないが、この蟺の陳腐化には耐えおる幎埌、私のこの戊略がだめな可胜性もある
もっず芋る
モデルに䟝存しない構成ず動的運甚の倧切さが滲み出おるポスト もうこの通りなので、誰かが人柱になっおノりハりを即時共有する仕組みが倧事 ちょっず前はいかに動かすかがテヌマだったのに今はいかに止めるかが重芁になりたした
もっず芋る
興味深いなあ プロダクト開発やっおるずきめちゃ楜しいし 倢䞭になるこずは進捗にずおも寄䞎するので その分詊行錯誀もたくさんできお リリヌスもアプデも早くお、ずなるず玠晎らしい あずは時間ず信頌ずコミット床のバランスが 倧切な芁玠だよなあ
もっず芋る
AIやクラりドやOS等は、デフォルト蚭定で本圓に安心しお䜿えお、ちょっず誀クリックしただけでは倖郚共有等されないようになっお欲しいです👀 説明の量も増やしお欲しい 。 倖郚共有開始時や倖郚共有状態になっおいる時等は、赀文字でビビらせるようにしお欲しい 。
もっず芋る
぀いにAnthropic, オヌプンりェむトに関しお声明出したか Darioの立堎は「open weightsを犁止」ではなく、モデルのオヌプン/クロヌズドではなく、その胜力ずリスクで線を匕き、根本の芏制を政府に芁求するずいうかたちかな。 芁点 • 危険な胜力を持たないopen-weightsモデルは、䌁業・開発者・研究者に䟡倀を提䟛するpublic good • 本圓の安党保障䞊の懞念は、暩嚁䞻矩囜家が米囜を超えるモデルを持぀こずず、匷力なモデルがサむバヌ・生物攻撃などに悪甚されるこず • 察策は米䌁業による利甚犁止ではなく、先端チップの茞出・密茞察策、倧芏暡distillationの抑止、open/closedを問わない高性胜モデルの事前安党性評䟡 • open weightsが防埡偎に有利ずいう䞻匵には慎重で、特に生物領域では攻撃偎が有利になる可胜性を実蚌的に怜蚌すべき —— Darioの立堎、open weightsかclosedかの二項察立ではなく、「どの胜力が、誰の手に枡るず、どこたで䞍可逆になるか」で線を匕こうずしおいるのが重芁だず思う 十分に匷いモデルはopen/closedを問わず事前の安党性評䟡が必芁で、䞭囜ぞの察策も米囜内での利甚犁止ではなく、先端チップ密茞や倧芏暡蒞留に絞るべきずいう敎理。 —— 䞀方で、原理䞻矩的だずも思っおいお、珟実には䞭囜がフロンティアモデルを蒞留し、オヌプンりェむトずしお公開しおしたっおいる以䞊、安党性評䟡やチップの密茞芏制だけで封じ蟌めるずいうのは、少し理想論に芋える。 しかも䞀床公開されたりェむトは回収できない。米囜䌁業だけがルヌルを守っお開発や公開を抑制する䞀方で、囜倖から同等に近いモデルが出続けるなら、安党性ず競争力の䞡方で非察称性が残る。 圌らには実態はLLMの販売ずいうビゞネスモデルしかないのでポゞショントヌクせざるを埗ないけど。 —— 日本においおも自囜完結の゜ブリンAIが求められる䞭、日本䌁業で唯䞀Sakana AIが眲名発衚しおるが、日本独自でのフロンティアモデルの孊習は蚈算資源の芳点で䞍可胜なので、オヌプンりェむトには賛同すべき
もっず芋る
There’s been a lot of speculation about where we stand on open-weights models. We’ve outlined our views in full here:
最近、日䞭に8時間連続で働くずいう感芚がなくなっおきた。 グロヌバルチヌム所属なので日本の深倜にミヌティングがある、ずいうだけではない。スマホでもパ゜コンでも、䜕か思い぀いたずきに゚ヌゞェントぞパッずお願いしお、できたらレビュヌする。仕事がそういう圢になっおきた。 ---- 䞀方で、1〜2時間くらい集䞭しお、自分の頭で考え続けないず䜜れないものもある。゚ヌゞェントぞお願いしお進められる仕事が増えるほど、こういうディヌプワヌクで䜕を出せるかが、その人のスキルや評䟡に盎結するようになる気がする。 なので、ずっず仕事をしおいるずいうより、必芁なずきに゚ヌゞェントぞ指瀺を出し、頭の状態がいい時間に深く考える。仕事が断続的になった感じ。 ---- 3カ月くらい前は、AIを回すたびにレビュヌが発生しお、普通に脳の負荷が高かった。゚ヌゞェントを増やしたら楜になるかず思ったら、レビュヌ地獄が増えただけ。 ここはワヌクフロヌずハヌネスを敎えお、途䞭を逐䞀芋なくおも、入り口ず出口だけレビュヌできるようにした。これがない状態でAlways Onにするず、ただ24時間仕事に远われる人になる。 ---- 入り口ず出口だけ芋ればいい状態になっお、起きおいる間い぀でも仕事を少し進められるようになった。でも、ずっず仕事のこずを考えおいるわけではない。家族ずの時間や自分の時間も、むしろ前より取りやすい。 ---- 産業革呜期の過酷な長時間劎働ぞの反発から生たれた8時間劎働性が、AI゚ヌゞェントによっお倉わるのではないか。連続で人間が皌働する働き方から、人は深く考える時間に集䞭し、その間も゚ヌゞェントが仕事を進める圢ぞ。これを健党に成立させるのは、AIのモデルの性胜よりワヌクフロヌであり、ハヌネスなんだろうな
もっず芋る
最近ハマっおる䜜業甚BGMのYouTubeチャンネル Shrimp ず Coffee Cat が奜き
半幎ほど前に䜜った瀟内゚ヌゞェント、圓時最新だったOpus 4.6のたたずっず動かしおいた。今日久しぶりにレビュヌしたら、割ずひどいタむポがあった。圓時こんなミスはしなかったはずなんだけどな  Opus 5が出お、4.6ぞの蚈算資源の割り圓おが枛った LLMの品質はモデル名に固定された倀ではない。LLMベンダヌ偎の掚論基盀や蚈算資源ぞの割り圓おが倉われば、同じ名前でも品質は党然倉わる。モデル名はバヌゞョン番号ではあっおも、品質保蚌ではない。 そう考えるず、䌁業のワヌクフロヌを特定モデルぞハヌドコヌドするのは思っおいた以䞊に危ない。党ワヌクフロヌで䜿うモデルを誰かが継続評䟡しお、劣化したら差し替える 珟実的じゃないよなぁ Cursor Routerのように甚途に応じおモデルを遞ぶ仕組みや、Notionのようにワヌクフロヌを特定モデルから切り離せる蚭蚈が必芁になる。モデルは郚品ずしお亀換できる状態にしおおく。䌁業の゚ヌゞェント運甚、ここを前提にしないず数幎埌かなりしんどそう。
もっず芋る
【LLMプロバむダヌの競争が「札束䜓力勝負」に倉わった話】 AnthropicがFableの延長をさらに続けお、OpenAIが5時間制限を撀廃した...衚面的には「ナヌザヌに優しくなったね」っお話に芋えるけど、これっお裏を返すず、もうモデルの性胜差では勝負が぀かなくなったっおこずなんだよな。 去幎たでは「モデルの賢さ」「孊習デヌタの豊富さ」「孊習方法の工倫」...みたいな、技術的な差別化で差が぀く䞖界だった。でも2026幎に入っお、あれだけ煜っおいたMythos/FableですらGPT5.6にあっさり远い぀かれお、ナヌザヌから芋るず「どれ䜿っおも倧䜓同じくらい賢い」状態になり぀぀ある。 じゃあ䜕で差別化するのっおなったずきに、答えが「蚈算資源をどれだけ持続的に、安く、倧量にナヌザヌに提䟛できるか」になった。今幎䞀番面癜い構造倉化だず思う。 ぀たり、​知胜の民䞻化→知胜の高床化の次に来たのが、蚈算資源の消耗戊​。 モデルの質で勝おないなら、䜿い攟題にしお囲い蟌む。䜿い攟題にするには、GPUクラスタの芏暡ず資金力がモノを蚀う。結局、技術の戊いが資本の戊いに倉わったわけで...SaaS業界で䜕床も芋おきたパタヌンではあるんだけど、AIでこれがここたで露骚に起きるのが2026幎前半たでに来るずは むヌロン・マスクの動き で、この文脈で振り返るず、今幎頭からのxAIによるCursor買収の動きがめちゃくちゃ戊略的に芋える。Cursorっお開発者向けには䜓隓レむダヌではロックできおお、そこに「うちのGrok䜿い攟題にするよ、蚈算資源も最沢に出すよ」っお持ちかけるのは、芁するにモデルではなくむンフラずディストリビュヌションで勝ずうずしおる。 むヌロンのやり方っお、い぀もプラットフォヌムごず抌さえにいくんだよな。Teslaしかり、Xしかり。AIでも同じで、「最高のモデルを䜜る」じゃなくお「AIが䜿われる堎所ごず抌さえる」方向に動いおる。この手広さはさすがずしか蚀えない。 Googleの沈黙 そしお䞀番怖いのがGoogle。このチキンレヌスにただ本栌参戊しおない。 AnthropicもOpenAIも蚈算資源の倧盀振る舞いで消耗戊やっおるのに、Googleはそこたで無理しおない。「ただ本気出しおないだけ」ずいう䜙裕すら感じる 考えおみれば、Googleは䞖界最倧芏暡のデヌタセンタヌむンフラを持っおお、TPUずいう自瀟チップがあっお、クラりド事業もある。蚈算資源の䜓力勝負になったら、本来䞀番有利なのはGoogleなんだよな。それなのにあえお今は静芳しおるっおこずは、他瀟が消耗しきったタむミングで䞀気に来る可胜性がある。 もしくは、蚈算資源の消耗戊自䜓が持続䞍可胜だず芋切っおお、その先の次のゲヌムチェンゞ䟋えばオンデバむスAIずか、怜玢・広告ずのさらなる統合ずかを仕蟌んでるのかもしれない。 プロダクトを䜜る偎から芋るず 自分がNotionでAIプロダクトに関わっおる立堎から蚀うず、この倉化は実はすごく重芁で。モデルの性胜差がなくなるっおこずは、​AIプロダクトの䟡倀はモデルそのものではなく、それをどう業務フロヌに組み蟌むか、どうナヌザヌ䜓隓ずしお仕䞊げるか​に完党にシフトする。 SalesforceでEinstein AIをやっおた頃にも同じこずを感じおたけど、圓時はただ「AIの性胜が足りない」が蚀い蚳になった。今はもうその蚀い蚳が通甚しない。モデルは十分賢い、蚈算資源も安くなる方向、じゃあプロダクトずしお䜕を䜜るか、ナヌザヌの仕事をどう倉えるか。そこだけが勝負になる。 この構造倉化、LLMプロバむダヌにずっおは消耗戊だけど、プロダクトビルダヌにずっおはむしろ远い颚なんだよな。むンフラが安くなっお、性胜が均質化しお、差別化のレむダヌが「䜓隓」に䞊がっおくる。ここからが本圓に面癜いフェヌズだず思う。
もっず芋る
できたヌ
ここたで来た。右䞋、巊䞋が絵柄なしの癜ずグレヌのグラデヌションのみで鬌畜
囜境を越え、自分のスクショが勝手に䜿われおた😂😂😂
新䜜ポッドキャスト曎新🔔 #27# 脱・チャットUIAI時代のむンタヌフェヌス進化ず次䞖代ワヌクフロヌ 「AIプロダクトのUIっおチャットでいいんだっけ」 ずっず自分の䞭でも匕っかかっおたテヌマに぀いお、OpenAI SymphonyフレヌムワヌクやClaude Code ゚ヌゞェントビュヌ、Notion゚ヌゞェント、最新のAI 3Dモデリングツヌルたで觊れ぀぀、次䞖代UIの圚り方を深掘り。機胜が増えるほど「削ぎ萜ずす力」が問われる時代ぜひ聎いおみおください
もっず芋る
SaaS䌁業のDeveloper PlatformやAPI、これたでずっず「開発者向け」のサむドプロゞェクト扱いだった。でもMCPが出お、゚ヌゞェントがCLIを普通に叩ける䞖界になるず、これが「新しいUI」になる。倉わるのはUIだけじゃない。ディストリビュヌションの圢そのものが倉わる ──── 埓来のSaaS䌁業はAPI呚りのディストリビュヌションを「セルフサヌブ」で回しおきた。ドキュメント曞いお、DevRelコミュニティ䜜っお、自己孊習・自己解決を促す。Salesforceにいた時もたさにこれだった。開発者が自力で孊べるから成立しおたディストリビュヌションモデル ──── でも゚ヌゞェント経由でAPIを䜿うのが非゚ンゞニア含めた倧量のナヌザヌになるず、セルフサヌブ型のディストリビュヌションは砎綻する。゚ヌゞェントが操䜜するむンタヌフェヌスこそがSaaSの最倧の顧客接点になるのに、倚くの䌁業はいただにAPIをコアプロダクトの「別枠」扱いしおる。リ゜ヌスもドキュメントも本流ずは別の䜍眮づけ ──── ゜フトりェアを本気でヘッドレス化しお業務に溶け蟌たせるなら、ディストリビュヌションそのものを倉えないず。APIやMCPにコアプロダクトず同等の投資・サポヌト・䜓隓蚭蚈を。「デベロッパヌ向けだから」で枈たせおた時代はもう終わり぀぀ある。ここに気づけるかどうかが次のフェヌズの分かれ目だず思う
もっず芋る
ちなみにこの䞀連の匕甚RTは、゚ヌゞェントが誀解しおしたった結果😂普通、返信にツリヌで曞くだろうがよ たあ蚘念に残しおおくか
もっず芋る
個人的な業務生産性のKPIは実は「゚ンタヌキヌを抌す数」。入力は音声でタむピングを枛らす、決たったタスクぱヌゞェントワヌクフロヌで自動化、Slackのスタンプで承認。そうするずだいぶ゚ンタヌキヌの抌す回数が枛る。これで業務が完党に゚ヌゞェントドリブンで進む
もっず芋る